Bez interneta klēpjdators atbild uz jautājumu. Tad to pašu jautājumu tam nosūta cita lietotne tajā pašā datorā un saņem atbildi, lai gan nekas nav mainīts. Ar šo soli tavs ierastais klēpjdators kļūst par nelielu personīgo MI serveri: tam pieprasījumus var sūtīt arī citas lietotnes un skripti.
Šeit runa ir par lejupielādēta modeļa darbināšanu, nevis apmācīšanu. Ja vēl neesi pārbaudījis, vai tavam klēpjdatoram pietiek RAM vai VRAM, vispirms izlasi rakstu par to, cik daudz RAM klēpjdatoram vajadzīgs lokālam MI. Ja jau zini, ka dators ir piemērots, lasi tālāk.
Ikviens lokālā MI risinājums sastāv no četrām atsevišķām daļām. Ja zini, kura par ko atbild, turpmākajiem soļiem būs vieglāk sekot.
Modeļa svari ir lejupielādējamais fails, piemēram, neliela modeļa kvantēta versija ar 3,4 GB lejupielādes apjomu. Šis skaitlis raksturo faila lielumu diskā, nevis RAM apjomu, kas modelim vajadzīgs darbības laikā.
Modeļa darbināšanas programma ielādē šo failu un atbild uz pieprasījumiem. Šajā ceļvedī tā ir Ollama, kas nodrošina savu lokālo HTTP API. Pateicoties šai programmai, modelim klēpjdatorā pieprasījumus var sūtīt arī citas lietotnes.
Klients nosūta pieprasījumu. Tas var būt Ollama iebūvētais čats, īss skripts vai cita lietotne. No klienta ir atkarīgs, vai pieprasījums paliek klēpjdatorā vai tiek nosūtīts citur.
Neobligāts dokumentu indekss ļauj čata modelim meklēt tavos failos. Tam vajadzīgs atsevišķs iegulšanas modelis un sava datu krātuve. Indekss neveidojas automātiski, un tā izveidi šeit neapskatām.
Īsumā: lietotne vai skripts sūta pieprasījumu uz 127.0.0.1:11434, kur to saņem Ollama un ielādē lejupielādēto modeli. Modeļa dzēšana neizdzēš klienta saglabāto sarakstes vēsturi, jo tā glabājas citur.
Pirms instalēšanas velti divas minūtes, lai pierakstītu sava klēpjdatora parametrus: RAM apjomu, operētājsistēmu un procesoru, atsevišķās videokartes atmiņas (VRAM) apjomu, ja tāda ir, un brīvo vietu SSD diskā. Kāpēc RAM un VRAM apjoms ir svarīgs, plašāk skaidrots rakstā par to, cik daudz RAM klēpjdatoram vajadzīgs lokālam MI.
Abi zemāk redzamie atjaunotie klēpjdatori ir īsti modeļi, kas pašlaik pieejami refurbed. Tie ir profesionāli pārbaudīti, iztīrīti un savesti kārtībā, un tiem ir 12 mēnešu garantija. Pirmais ir Apple Silicon klāsta sākuma līmeņa modelis, otrs ir Windows klēpjdators ar atsevišķu grafisko atmiņu. Ar katru no tiem pietiek, lai izpildītu visus turpmākos soļus.
Datorā ar macOS vai Windows instalē oficiālo Ollama lietotni; Linux gadījumā seko tās instalēšanas instrukcijai. Kad instalēšana pabeigta, atver Ollama. Linux sistēmā palaid ollama serve, ja serveris vēl nedarbojas.
Pašreizējā Ollama lietotnē var gan darbināt modeli lokāli, gan izmantot mākoņpakalpojuma iespējas. Izvēlies lejupielādēta lokālā modeļa tagu: modeļa darbināšanai savā klēpjdatorā nav jāpiesakās kontā.
Lai varētu sekot šiem soļiem, lejupielādē modeli ar precīzu tagu qwen3.5:4b-q4_K_M. Lejupielādes apjoms ir 3,4 GB. Tags ir svarīgs: vispārīgais „latest“ nemanot var norādīt uz daudz lielāku modeli nekā pārbaudītais. Šie 3,4 GB ir lejupielādes apjoms diskā, nevis RAM prasība. Pēc faila lieluma nevar noteikt, cik daudz atmiņas modelim vajadzēs atbilžu ģenerēšanai.
Lai pirmoreiz sarunātos ar modeli, vajag tikai divas komandas:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Pirmā komanda lejupielādē modeli, bet otrā atver interaktīvu čatu. Vispārīgas sasveicināšanās vietā dod modelim nelielu, īstu uzdevumu, piemēram: „Pārvērt šīs trīs sapulces piezīmes veicamo darbu sarakstā. Neizdomā datumus.“
Kad saruna pabeigta, ieraksti /bye, lai izietu no čata.
Termināļa čatā ar modeļa darbināšanas programmu sazinās klients. Tagad nosūti programmai pieprasījumu tieši, tāpat kā to darītu cita lietotne.
macOS vai Linux datorā:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'
Windows datorā ar PowerShell:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'
Atbildi meklē laukā message.content. Iestatot stream vērtību false, saņem vienu pilnu atbildi, nevis fragmentu plūsmu. Savukārt num_ctx: 4096 pirmajai pārbaudei nosaka salīdzinoši nelielu konteksta apjomu, salīdzinot ar daudz lielāko modeļa aprakstā norādīto maksimumu.
Ollama atgriež ne tikai atbildes tekstu. Līdzās message.content redzami arī laika mērījumi un skaitītāji, kam vērts pievērst uzmanību: load_duration, prompt_eval_count, prompt_eval_duration, eval_count un eval_duration.
Šie rādītāji ļauj nošķirt divus posmus, ko viens skaitlis „tokeni sekundē“ neatklāj: modeļa ielādi atmiņā un atbildes ģenerēšanu. Pirmais pieprasījums pēc Ollama palaišanas parasti aizņem visvairāk laika, jo modelis vispirms jāielādē atmiņā; nākamajā pieprasījumā tas vairs nav jādara.
Precīzie skaitļi pilnībā atkarīgi no tava datora, tāpēc šeit nevienu no tiem nepasniedzam kā tipisku. Salīdzini rādītājus divos mēģinājumos ar vienu un to pašu klēpjdatoru, nevis paļaujies uz vienu apgalvojumu par ātrumu.
Trīs komandas palīdz veikt svarīgākās darbības ar modeļiem.
ollama ps parāda, kuri modeļi pašlaik ir ielādēti un kur tie darbojas. Kolonnā par procesoru redzēsi 100% GPU, 100% CPU vai starp tiem sadalītu slodzi.
ollama ls parāda visus lejupielādētos modeļus.
ollama rm qwen3.5:4b-q4_K_M izdzēš lejupielādēto modeli, kas tev vairs nav vajadzīgs.
Pēc noklusējuma Ollama izņem modeli no atmiņas pēc piecu minūšu dīkstāves. Ja ollama ps nerāda nevienu ielādētu modeli, pirms secini, ka kaut kas nedarbojas, nosūti vēl vienu pieprasījumu.
Tagad klēpjdators var apkalpot arī otru lietotni: tā sūta pieprasījumus modelim tajā pašā datorā, nevis mākoņpakalpojumam.
Lielākā daļa lietotņu, kas ļauj norādīt pielāgotu, ar OpenAI saderīgu piekļuves punktu, prasa trīs lietas: bāzes URL, modeļa nosaukumu un API atslēgu. Kā bāzes URL ievadi http://localhost:11434/v1/, bet kā modeļa nosaukumu norādi qwen3.5:4b-q4_K_M.
API atslēgas lauks var mulsināt. Dažas lietotnes to neļauj atstāt tukšu, tāpēc Ollama dokumentācijā izmantota vietture api_key='ollama'. Dokumentācijā arī skaidri teikts: lokālajam serverim vajadzīga netukša vērtība, taču tās saturu tas ignorē. Šī virkne neveic autentifikāciju; tā ir veidlapas vietture, nevis parole.
Šī saderība neaptver visas katras API iespējas. Pirms paļaujies uz kādu funkciju, piemēram, attēlu ievadi vai rīku izsaukšanu, pārbaudi to tieši savā lietotnē. Nepieņem, ka darbosies pilnīgi viss.
Līdz šim teorētiski pieprasījumi joprojām varēja nemanāmi nonākt internetā. Vienkārša pārbaude ļaus to izslēgt.
Kad modelis lejupielādēts, izslēdz klēpjdatora Wi-Fi vai atvieno tīkla kabeli. Pēc tam atkārto iepriekš nosūtīto pieprasījumu čatā vai ar API. Ja saņem īstu atbildi, lai gan nav nekāda interneta savienojuma, tas pierāda, ka modelis darbojas lokāli.
Par pierādījumu nevar uzskatīt atbildi, ko saņem tikai ar interneta pieslēgumu, atbildi no https://ollama.com, nevis localhost, vai mākoņa modeļa tagu lejupielādēta modeļa taga vietā. Lokālus pieprasījumus Ollama apstrādā tavā datorā, bet tās atsevišķie mākoņa modeļi izmanto attālinātu pakalpojumu.
Privātumu te nevar atstāt pašplūsmā. Ir vērts saprast, kas šo risinājumu aizsargā un kas ne.
Pēc noklusējuma Ollama pieņem savienojumus tikai no tava klēpjdatora, adresē 127.0.0.1:11434. Atstāj šo iestatījumu nemainītu. Neiestati OLLAMA_HOST=0.0.0.0 un nepāradresē portu 11434 uz publisko internetu: iepriekš minētā API atslēgas vietture neko nepārbauda. Šādi atvērts ports paliek neaizsargāts.
Ja vēlies pilnībā izslēgt Ollama mākoņa funkcijas, vari to darīt, taču tas nav obligāti: ar lejupielādēta lokālā modeļa tagu modelis jau darbojas lokāli. Pievieno {"disable_ollama_cloud": true} failam ~/.ollama/server.json vai iestati OLLAMA_NO_CLOUD=1. Pēc jebkuras no šīm izmaiņām pārstartē Ollama, lai izmaiņas stātos spēkā.
Ja vēlies piekļūt šim serverim no citas telpas vai ierīces, tas ir atsevišķs, sarežģītāks jautājums: vajadzīgs privāts tīkls un starpniekserveris ar autentifikāciju. Šeit šādu iestatīšanu neapskatām; tieši atvērt portu internetam nav pareizais risinājums.
Īsumā par biežākajām problēmām un to, ko vispirms pārbaudīt.
Savienojums atteikts. Pārliecinies, ka darbojas Ollama lietotne vai ollama serve, un mēģini vēlreiz.
Pirmā atbilde ir lēna, nākamās – ātrākas. Pie vainas ir modeļa ielādei vajadzīgais laiks, nevis atbildes ģenerēšanas ātrums. Atšķirību redzēsi iepriekš aplūkotajos atbildes laukos.
Viss šķiet daudz lēnāks, nekā gaidīji. Palaid ollama ps: iespējams, modelis darbojas tikai ar CPU vai slodze tiek dalīta starp CPU un GPU. Pārbaudi savas videokartes un draiveru atbalstu konkrētajai operētājsistēmai.
Trūkst atmiņas vai programma negaidīti pārstāj darboties. Izvēlies mazāku modeļa tagu, samazini num_ctx un pirms nākamā mēģinājuma aizver citas lietotnes, kas patērē daudz atmiņas.
Diskā sāk trūkt vietas. Ar ollama ls apskati lejupielādētos modeļus, pēc tam ar ollama rm izdzēs tos, kurus neizmanto.
Ja šis risinājums tev neder, piemēram, vēlies pārlūkot modeļus grafiskā saskarnē vai precīzāk kontrolēt CPU un GPU izmantošanu, apskati LM Studio un llama.cpp. Tie ir iemesli mainīt modeļa darbināšanas programmu, nevis darbināt divus risinājumus paralēli.
Vai pēc iestatīšanas vēl būs vajadzīgs internets? Nē. Kad modelis ir lejupielādēts, gan čats, gan pieprasījumi tā API darbojas pilnībā bez interneta.
Vai API atslēgas vietture pasargā manu piekļuves punktu? Nē. Ollama lokālais serveris pieņem jebkuru netukšu vērtību, bet tās saturu nepārbauda. Tāpēc atslēga, ko pieprasa dažas lietotnes, nav drošības līdzeklis.
Vai mans pieprasījums paliek klēpjdatorā? Jā, ja izmanto lejupielādēta lokālā modeļa tagu. Ollama piedāvā arī atsevišķus mākoņa modeļus; tiem pieprasījumi nonāk attālinātā pakalpojumā. Atšķirību nosaka izvēlētais tags, nevis kāds slēpts noklusējuma iestatījums.
Vai vajadzīga atsevišķa videokarte? Nē. Klēpjdators var darbināt nelielu modeli, izmantojot tikai CPU, parasti gan lēnāk. ollama ps rāda, kā tika apstrādāts konkrētais pieprasījums.
Ko darīt, ja vēlos lielāku vai citu modeli? Tajās pašās ollama pull un ollama run komandās nomaini modeļa tagu, taču vispirms pārbaudi RAM un VRAM apjomu. Plašāku skaidrojumu atradīsi rakstā par to, cik daudz RAM klēpjdatoram vajadzīgs lokālam MI.
Vai modelis turpmāk atcerēsies manus dokumentus? Nē. Čata modelis pats par sevi pastāvīgi neatceras mapes saturu. Lai meklētu savos failos, vajadzīgs atsevišķs dokumentu indekss. Tas ir neobligāts risinājums, ko šeit neapskatām.
Izvēlies vienu īstu uzdevumu un izmēģini to ar abiem tikko iestatītajiem klientiem: iebūvēto čatu un pieslēgto otru lietotni. Piemēram, vari palūgt apkopot personīgu piezīmi, sagrupēt vairākus failus, piešķirot grupām nosaukumus, vai vienkāršā valodā izskaidrot īsu koda fragmentu.
Lai ko izvēlētos, pieraksti precīzu modeļa tagu, modeļa darbināšanas programmas versiju, konteksta iestatījumu, URL un pašu uzdevumu. Tā vēlāk tu vai kāds cits varēs atkārtot to pašu pārbaudi.
Ja atklājās, ka tavam klēpjdatoram šim uzdevumam pietrūkst RAM vai VRAM, ir vērts apsvērt datoru ar lielāku atmiņas rezervi. Nākamajā šīs sērijas rakstā apskatīsim, kā izveidot nelielu modeļu komplektu: vienu sarunām, vienu kodam un vienu meklēšanai.
Pirmoreiz piesakies mūsu jaunumu vēstkopai un ietaupi 15 €!
Nekad vairs nepalaidiet garām nevienu piedāvājumu.
Informāciju par personas datu izmantošanu varat atrast mūsu Privātuma politikā.
Apstiprināt reģistrēšanos
Gandrīz pabeigts: mēs jums nosūtījām apstiprinājuma e‑pastu