qwen3.5:4b-q4_K_M jau spēj rakstīt tekstus, izskaidrot un atbildēt uz ikdienas jautājumiem bez interneta savienojuma parastā klēpjdatorā ar 16 GB atmiņu. Ar šo modeli jau iepazināmies sērijas otrajā daļā. Tas ir labs palīgs ikdienas sarunām, taču failu meklēšanu un programmēšanas uzdevumus tam nevajadzētu uzticēt. Ja vienu lejupielādētu modeli izmanto visiem darbiem, tam jāuzņemas pārāk daudz. Labāk izvēlēties trīs mazus modeļus, no kuriem katrs noder savā uzdevumā.
Pārzināt lokālā MI vidi nozīmē apzināti izvēlēties modeli, darbināšanas rīku un licenci, kā arī zināt, kuri dati kur paliek. Ja vēl neesi pārbaudījis klēpjdatora operatīvās atmiņas (RAM) vai videoatmiņas (VRAM) apjomu, vispirms izlasi, cik daudz RAM klēpjdatoram vajag lokālajam MI. Ja vēl neesi uzstādījis Ollama, pamācībā uzzināsi, kā iestatīt pirmo lokālā MI pakalpojumu sniedzēju. Šeit pieņemam, ka abi soļi jau ir veikti. Tālāk noskaidrosim, kurus modeļus izvēlēties un kā pārbaudīt, vai tie ir labi?
Noderīgā lokālā MI komplektā trim atšķirīgiem uzdevumiem ir trīs modeļi, nevis viens, kam jāpaveic viss.
Vispārīgais palīgs ikdienas sarunām, tekstu rakstīšanai un ātriem jautājumiem ir qwen3.5:4b-q4_K_M. Lejupielādes apjoms ir 3,4 GB; tas ir tas pats tags, ko izmantojām otrajā daļā.
Mazs modelis konkrētam uzdevumam, piemēram, strukturētai izvadei vai spriešanas uzdevumam ar skaidriem ierobežojumiem, ir granite4.2:3b. Tā lejupielādes apjoms ir 2,2 GB, tam ir Apache 2.0 licence, un tas izlaists 2026. gada augustā. Tālāk, 6. sadaļā, apskatīsim arī citus modeļus programmēšanai, matemātikai, attēlu apstrādei un tulkošanai. Šo modeli vari aizstāt ar tādu, kas atbilst tavam uzdevumam.
Teksta iegulumu modelis dokumentu meklēšanai ir embeddinggemma:300m, kura lejupielādes apjoms ir 622 MB. Tas nav sarunu modelis: tas pārvērš tekstu vektoros, kuros meklēšanas lietotne var atrast vajadzīgo informāciju. Pilns skaidrojums ir 8. sadaļā.
Trīs lejupielādes diskā kopā aizņem aptuveni 6,2 GB. Tas nenozīmē, ka klēpjdatorā pietiks brīvās atmiņas, lai visus trīs modeļus ielādētu vienlaikus. Katram uzdevumam ielādē vienu modeli, pārbaudi to reālā darbā un izdzēs tos, kas nav noderīgi.
Kvantizācijas ietekmi visvieglāk pamanīt vienas modeļu saimes ietvaros. Ollama katalogā qwen3.5:9b-q4_K_M lejupielādes apjoms ir 6,6 GB, qwen3.5:9b-q8_0 – 11 GB, bet qwen3.5:9b-bf16 – 19 GB. Vieni un tie paši modeļa svari trīs precizitātes pakāpēs nozīmē trīs atšķirīgus lejupielādes apjomus.
Tie ir katalogā norādītie lejupielādes apjomi, nevis garantēts atmiņas patēriņš pēc modeļa ielādes. Zemāka precizitāte samazina faila lielumu un bieži arī atmiņas patēriņu darbības laikā. Tas, vai un cik daudz pasliktinās atbilžu kvalitāte, ir atkarīgs no modeļa, kvantizācijas metodes un uzdevuma. Neuzskati, ka kvalitāte noteikti paliks nemainīga vai ka mazāks fails ir ieguvums bez kompromisiem.
Atmiņa vajadzīga ne tikai ielādētajiem modeļa svariem. To izmanto arī konteksta logs un tā atslēgu un vērtību kešatmiņa, kā arī citas palaistās programmas. Kvantizācijas ietaupītā atmiņa vēl negarantē, ka pietiks vietas lielākam modelim. Tā tikai palielina izredzes salīdzinājumā ar mēģinājumu vispirms ielādēt pilnas precizitātes failu.
Divus kataloga apzīmējumus ir viegli pārprast. Abos gadījumos vari lejupielādēt nepareizo modeli.
Pirmais slazds. Google sava modeļa aprakstā norāda, ka Gemma 4 E2B ir 2,3 miljardi „efektīvo“ valodas parametru. Tas var radīt iespaidu, ka fails ir mazs. Taču Ollama lejupielādes apjoms ir 7,2 GB, gandrīz tikpat, cik gemma4:12b Q4 tagam ar 7,6 GB. Lai novērtētu, vai modelim pietiks vietas tavā klēpjdatorā, skaties lejupielādes apjomu, nevis parametru apzīmējumu.
Otrais slazds. Ja tagā nenorādi konkrētu variantu, vari nemanot iegūt citu modeli. Lejupielādējot tikai granite4.2, iegūsi 8B modeli ar 5,3 GB apjomu, nevis 2. sadaļā minēto 3B tagu ar 2,2 GB. Lejupielādējot tikai qwen3-embedding, iegūsi 8B modeli ar 4,7 GB apjomu, nevis 8. sadaļā izmantoto 0,6B tagu ar 639 MB.
Abos gadījumos rīkojies vienādi: lejupielādē modeli ar pilnu, precīzu tagu, nevis tikai saimes nosaukumu. Pirms pieņem, ka esi ieguvis izmēģināšanai paredzēto modeli, pārbaudi lejupielādes apjomu.
Katalogā norādītais maksimums, piemēram, 128K vai 256K tokenu, rāda, cik daudz modelis principā spēj uzņemt. Tas nenozīmē, ka klēpjdatoram ar 16 GB atmiņu pietiks resursu tik garam kontekstam.
Ollama noklusējuma konteksts ir 4096 tokeni. To var palielināt, taču atmiņas patēriņš aug gan ar garāku kontekstu, gan ar lielāku paralēlo pieprasījumu skaitu. Šīs sērijas otrajā daļā izmantotais iestatījums num_ctx: 4096 ir šī pati piesardzīgā noklusējuma vērtība, nevis nejauši izvēlēts apaļš skaitlis.
Jaunu modeli sākumā izmēģini ar 4K–8K tokenu kontekstu un vienu aktīvu sesiju. Vienlaikus seko sistēmas atmiņas patēriņam. Kontekstu palielini tikai pēc tam, kad esi pārliecinājies, ka atmiņas patēriņš ir stabils, nevis tikai tāpēc, ka katalogā norādīts lielāks teorētiskais maksimums.
Visiem īpašajiem uzdevumiem nav viena labākā modeļa. Izvēli nosaka tas, kas tev jāpaveic, un ir vairāki mazi modeļi, kurus vērts pārbaudīt.
Programmēšana: qwen2.5-coder:3b (1,9 GB) vai lielākais qwen2.5-coder:7b (4,7 GB). Abiem ir Apache 2.0 licence.
Matemātikas vai loģikas uzdevumi ar skaidriem ierobežojumiem: Microsoft phi4-mini:3.8b (2,5 GB).
Jautājumi par attēliem un ekrānuzņēmumiem: gemma4:e2b (7,2 GB) vai gemma4:12b Q4 (7,6 GB). Abiem ir Apache 2.0 licence, un abu aprakstos norādīts, ka tie pieņem tekstu un attēlus.
Rakstīšana vairākās valodās vai tulkošana: aya-expanse:8b (5,1 GB), kas veidots darbam ar 23 valodām.
Licences atruna šeit ir pārāk svarīga, lai to atstātu zemsvītras piezīmei: Aya Expanse 8B ir CC-BY-NC-4.0 licence ar papildu noteikumiem nekomerciālai izmantošanai. Atšķirībā no iepriekš minētajiem modeļiem ar Apache licenci to nevar uzskatīt par izvēli bez lietošanas ierobežojumiem. Ja neviens no šiem variantiem neatbilst tavam uzdevumam, 2. sadaļā minētais granite4.2:3b joprojām ir vispārīgā izvēle spriešanas uzdevumiem.
Pirms izvēles pārbaudi modeli savā uzdevumā. Tas ir noderīgs tad, ja palīdz paveikt tevis prasīto, nevis tāpēc, ka ieņem augstu vietu kāda cita reitingā.
Pieci īsi pārbaudījumi par modeli pasaka vairāk nekā kataloga apraksts. Katram kandidātam dod vienus un tos pašus piecus uzdevumus, izmantojot savus materiālus.
1. Kopsavilkums ar pamatojumu. Iedod modelim 250 vārdu garu piezīmi un palūdz nosaukt trīs veicamos darbus, katram norādot teikumu, no kura tas izriet. Atzīmē visu, kam tekstā nav pamatojuma.
2. Strukturēta informācijas izvilkšana. Izdomā piecas tikšanās, norādot vārdus un datumus. Palūdz izveidot JSON ar tieši tevis noteiktajiem laukiem un pārbaudi visus piecus ierakstus pret sākotnējo tekstu.
3. Koda labošana. Iedod vienu nelielu funkciju, kas neiztur pārbaudi, un vienu testu. Pieraksti, vai pēc modeļa labojuma tests ir sekmīgs. Visiem salīdzinātajiem modeļiem izmanto vienu un to pašu repozitoriju un kontekstu.
4. Valodu pāris. Palūdz cilvēkam, kurš labi pārvalda tulkojuma valodu, pārbaudīt, vai reālistiskā rindkopā pēc tulkošanas saglabāti vārdi, skaitļi un nianses. Daudzvalodu prasmes nevērtē tikai pēc angliski formulēta uzdevuma.
5. Jautājums par attēlu, tikai modeļiem, kas spēj apstrādāt attēlus. Parādi diagrammu vai ekrānuzņēmumu, kurā atbildi var pārbaudīt, un pārliecinies, ka nosūtīts pats attēls, nevis tikai faila nosaukums.
Katrā pārbaudē pieraksti, vai atbilde sakrīt ar tev zināmo, vai modelis ievēroja norādījumus un vai tas kaut ko izdomāja. Fiksē arī laiku līdz pirmajam redzamajam izvades fragmentam, kopējo laiku, tokenu skaitu un to, vai modelis darbojās ar CPU vai GPU. Noderīgumu un ātrumu vērtē atsevišķi: spriešana pirms atbildes var prasīt laiku un izmantot tokenus, kurus tu neredzi.
Iegulumu modelim no 2. sadaļas ir viens uzdevums: pārvērst tekstu vektoros, kuros meklēšanas lietotne var meklēt. Pats par sevi tas uz jautājumiem neatbild.
Darbībām ir noteikta secība. Vispirms tavus failus sadala fragmentos. Iegulumu modelis katru fragmentu pārvērš vektorā, un tos glabā lokālā vektoru krātuvē. Arī tavs vaicājums tiek pārvērsts vektorā. Sistēma atrod tam tuvākos fragmentus; tikai pēc tam sarunu modelis izmanto atrastos fragmentus, lai sniegtu atbildi ar atsaucēm uz tiem.
Sarunu modelis nav apmācīts ar taviem dokumentiem. Kad uzdod jautājumu, tas redz tikai to, ko tam nodod meklēšanas posms.
Ideju var pārbaudīt nelielā izmēģinājumā bez sarežģītas sagatavošanās: indeksē piecas piezīmes, kas tev jau ir. Uzdod vienu jautājumu, uz kuru atbilde ir kādā no tām, un otru, uz kuru atbildes nav nevienā. Ja sistēma darbojas pareizi, uz pirmo jautājumu tā atrod vajadzīgo fragmentu un atbildē uz to atsaucas. Uz otro tai jāatzīst, ka pamatojuma nav, nevis jāizdomā atbilde. Meklēšanas kvalitāti un galīgo atbildi vērtē atsevišķi.
Pirms lejupielādes pārbaudi pilnu iegulumu modeļa tagu: embeddinggemma:300m vai qwen3-embedding:0.6b. Iemesls ir tas pats, kas 4. sadaļā: ar saimes nosaukumu vien nepietiek, lai norādītu vajadzīgo modeli.
Modelis ar tādu apzīmējumu kā „26B A4B“ katra ģenerētā tokena apstrādei izmanto tikai daļu savu parametru. Tomēr visi 26B modeļa svari joprojām kaut kur jāglabā vai jāielasa pakāpeniski. Mazāks aktīvo parametru skaits nenozīmē mazāku failu un arī negarantē mazāku atmiņas patēriņu.
Šajā ceļvedī nav jaunu, īpaši tam izmērītu veiktspējas testu rezultātu. Ja skaitlis nāk no cita avota, vērtē to attiecīgā avota kontekstā. Piemēram, viena cilvēka ziņojums par aptuveni 18,5 tokeniem sekundē neierastā 26B ekspertu maisījuma konfigurācijā ar vecāku procesoru un GPU ar 6 GB atmiņu raksturo tikai šo konfigurāciju uz šī cilvēka datora. Tā nav vispārīga prognoze katram modelim ar šādu apzīmējumu.
Šo komplektu pārbaudījām ar diviem reāliem, šobrīd pieejamiem klēpjdatoriem, tiem pašiem, kas izmantoti sērijas otrajā daļā: sākuma līmeņa Apple Silicon datoru un Windows darbstaciju ar atsevišķu videoatmiņu. Abi ir atjaunoti, proti, profesionāli pārbaudīti, iztīrīti un sagatavoti turpmākai lietošanai. Vietnē refurbed abiem ir 12 mēnešu garantija, un katrā bez grūtībām pietiek vietas šim komplektam, ja modeļus ielādē pa vienam.
13 collu MacBook Air (2026) ar M5 mikroshēmu standarta komplektācijā ir 16 GB vienotās atmiņas; to var konfigurēt līdz 32 GB. Dell Precision 7730 ir 32 GB sistēmas atmiņas un atsevišķi 6 GB NVIDIA videoatmiņas (VRAM). Tie ir divi atšķirīgi atmiņas apjomi, nevis viens kopējs skaitlis.
Šeit tos nepieminam, lai mudinātu pirkt. Tie ir konkrētie datori, ar kuriem pārbaudījām ceļvedi, lai tu savu klēpjdatoru varētu salīdzināt ar reāliem piemēriem, nevis tikai ar reklāmas specifikāciju tabulu.
Licence attiecas uz konkrētu modeli, nevis visu saimi. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B un Gemma 4 E2B ir Apache 2.0 licence. Aya Expanse 8B ir CC-BY-NC-4.0 licence ar papildu noteikumiem nekomerciālai izmantošanai, kā jau minēts 6. sadaļā. Iespēja lejupielādēt modeļa svarus, autortiesību atļauja tos izmantot un tas, vai pats modelis tev „pieder“, ir trīs dažādas lietas. Pārbaudi aktuālo informāciju tieši par to modeli, kura tagu lejupielādē, nevis tikai par modeļu saimi.
Lai rīku komplekts paliktu neliels, pie izvēlētajiem modeļiem laiku pa laikam jāatgriežas. Komanda ollama rm noņem lejupielādētu modeli, kas nav bijis noderīgs. Piemēram, kad zini, ka aya-expanse:8b neizmantosi, vari izpildīt ollama rm aya-expanse:8b. Komanda ollama ls rāda, kas saglabāts diskā, bet ollama ps – kas pašlaik ielādēts. Katalogi mainās, tāpēc laiku pa laikam pārskati izvēlētos modeļus, nevis bez pārbaudes paļaujies uz lēmumu, ko pieņēmi pirms vairākiem mēnešiem.
Arī mazi modeļi var izdomāt neesošu teksta fragmentu, palaist garām niansi citā valodā vai uzrakstīt kodu, kas šķiet pareizs, bet neiztur testu. Katru šeit minēto ieteikumu pārbaudi pats. Svarīgos jautājumos šāda pārbaude neaizstāj eksperta vērtējumu.
Vai visus trīs komplekta modeļus var darbināt vienlaikus? Klēpjdatorā ar 16 GB atmiņu tas, visticamāk, nebūs ērti. Katram uzdevumam ielādē vienu modeli un pēc tam to nomaini, nevis vienlaikus turi atmiņā vispārīgo palīgu, konkrēta uzdevuma modeli un iegulumu modeli.
Vai iegulumu modelim vajadzīgs GPU? Nē. embeddinggemma:300m ir pietiekami mazs, lai to pārbaudītu tikai ar CPU, tomēr izmēri darbības laiku, nevis pieņem, ka rezultātu saņemsi uzreiz.
Vai lielāks modelis vienmēr sniedz labāku atbildi? Nē. Tas, vai labāk veiksies 4B vai 9B modelim, ir atkarīgs no uzdevuma. Tāpēc 7. sadaļā piedāvāta piecu uzdevumu pārbaude, nevis paļaušanās uz vienu skaitli modeļu reitingā.
Vai ar Q4 versiju pietiek? Tas atkarīgs no uzdevuma. Ja atmiņas pietiek abām versijām, savos trīs testos salīdzini Q4 tagu ar tā paša modeļa Q8 variantu, kā aprakstīts 3. sadaļā.
Vai Aya Expanse drīkst izmantot komerciālā projektā? Ne pēc noklusējuma. CC-BY-NC-4.0 licence paredz nekomerciālu izmantošanu, un ir spēkā arī papildu noteikumi. Pirms pieņem pretējo, pārbaudi aktuālo modeļa aprakstu.
Vai iegulumu modelim pēc lejupielādes vajadzīgs internets? Nē. Tāpat kā pārējie šī komplekta modeļi, tas darbojas bezsaistē, tiklīdz modeļa svari ir saglabāti diskā.
Uz klēpjdatora, kura atmiņas vajadzības palīdzēja novērtēt sērijas pirmā daļa un kuru palīdzēja iestatīt otrā, uzstādi 4B vispārīgo palīgu un vienu savam uzdevumam piemērotu modeli. Izveido savu trīs jautājumu pārbaudi pēc 7. sadaļā aprakstītās metodes. Paturi modeli, kas palīdz, bet otru noņem ar ollama rm. Par papildu atmiņas iegādi domā tikai tad, kad reāls uzdevums, nevis specifikāciju lapa, ir parādījis, ka tieši atmiņa ir ierobežojums.
Ar to šī trīsdaļīgā sērija noslēdzas. Ja izrādījās, ka tavam klēpjdatoram vispirms vajag vairāk atmiņas, klēpjdatoru kategorija ir piemērota vieta, kur sākt meklēt.
Pirmoreiz piesakies mūsu jaunumu vēstkopai un ietaupi 15 €!
Nekad vairs nepalaidiet garām nevienu piedāvājumu.
Informāciju par personas datu izmantošanu varat atrast mūsu Privātuma politikā.
Apstiprināt reģistrēšanos
Gandrīz pabeigts: mēs jums nosūtījām apstiprinājuma e‑pastu