128 gigatavun mini-PC voi ladata mallin, joka ei mahdu RTX 5090:n 32 gigatavun muistiin. RTX 5090 voi silti tuottaa vastauksen nopeammin silloin, kun malli mahtuu kokonaan näytönohjaimelle. Toteutuva ero riippuu mallista, kontekstista ja ajoympäristöstä.
Siksi paikalliselle kielimallille ei ole yhtä parasta tietokonetta. Valinta ratkeaa kolmella kysymyksellä:
Mahtuuko tarkka mallitiedosto, konteksti ja käyttövara laitteelle?
Tuottaako laite vastauksen riittävän nopeasti?
Sopiiko kone arkeen melun, koon, sähkönkulutuksen, ohjelmistotuen ja hinnan kannalta?
Tämä opas keskittyy paikalliseen inferenssiin eli valmiin mallin käyttämiseen.
Tilanne tarkistettu 29.8.2026. Apple julkisti uudet M6- ja M5 Pro -Mac minit sekä M5 Max- ja M5 Ultra -Mac Studiot 25.8.2026. Toimitukset alkavat 22.9.2026, joten riippumattomat testit myyntilaitteilla ja paikallisilla kielimalleilla puuttuvat vielä. Suomen hinnat ja saatavuus kannattaa tarkistaa ostopäivänä.
Nopea vastaus: mikä kone mihinkin käyttöön?
Käyttötapa | Järkevä lähtökohta | Mitä näyttö kertoo? | Tärkein rajoite |
|---|---|---|---|
7B-14B-mallit henkilökohtaiseen käyttöön | Nykyinen kohtuullisen uusi Mac tai PC | Pienet kvantisoidut mallit toimivat monella nykykoneella | Uusi ostos voi olla tarpeeton |
Kokonaismuistitarve enintään 24 Gt | Käytetty RTX 3090 -kone | Ehdollinen 24 Gt:n arvovaihtoehto, kun koko kokoonpanon Suomen hinta on kilpailukykyinen | Käytetyn kortin kunto, 350 W:n korttiteho ja 24 Gt:n katto |
Kokonaismuistitarve yli 24 Gt mutta enintään 32 Gt | RTX 5090 -työasema | ComputingForGeeksin testissä nopein kuluttajakortti Llama 3.1 8B- ja Qwen2.5 32B -malleilla | Tulos ei yleisty kaikkiin malleihin, ja 32 Gt ei riitä tiheälle 70B Q4 -mallille |
Tiheä 70B lyhyellä kontekstilla | Vähintään 48 Gt mallille käytettävää nopeaa muistia | Yhden kortin 48 Gt voi riittää tapauskohtaisesti | Pidempi konteksti ja rinnakkaiskuorma voivat nostaa tarpeen 96-128 gigatavuun tai suuremmaksi |
Suuri malli kompaktissa koneessa | 128 Gt:n Strix Halo -mini-PC | Suuri yhtenäismuisti mahdollistaa 70B- ja joitakin suurempia malleja | Tiheän 70B-mallin generointi voi jäädä noin viiden tokenin sekuntinopeuteen |
Suuri malli valmiissa CUDA-pöytälaitteessa | NVIDIA DGX Spark | 128 Gt:n muisti ja valmis CUDA-ohjelmistopino | 200B-tuki kertoo kapasiteetista, ei yleisestä vastausnopeudesta |
70B, pitkä konteksti tai monta käyttäjää | RTX PRO 6000 -luokka tai suunniteltu usean GPU:n työasema | 96 Gt yhdellä ammattikortilla helpottaa muistibudjettia | Hinta, 600 W:n teholuokka ja työasemainfrastruktuuri |
Suuri muisti macOS-pöytäkoneessa | M5 Pro Mac mini tai M5 Max/M5 Ultra Mac Studio | Muistikatot ovat 64, 128 ja 512 Gt | Riippumaton suorituskykynäyttö puuttuu vielä |
Suuri muisti mukana kulkevassa koneessa | M5 Max MacBook Pro | Enintään 128 Gt yhtenäismuistia | Korkea hinta, lämpörajat ja juotettu muisti |
Pikalistan tärkein rivi on ensimmäinen. Testaa nykyinen kone ennen ostamista. Paikallinen tekoäly omalla koneella -opas auttaa Ollaman, LM Studion ja muiden tavallisten työkalujen alkuun.
Euromääräinen voittajalista vanhenisi nopeasti. Kokoonpano, arvonlisävero, saatavuus ja käytettyjen näytönohjainten kunto vaikuttavat hintaan enemmän kuin siisti dollarihinnan muunnos antaisi ymmärtää. Vertaa Suomessa toteutuvaa kokonaishintaa vasta, kun sopiva laiteluokka on selvillä.
Taulukon teholuvut eivät ole keskenään suoraan vertailukelpoisia. RTX 3090:n ja RTX PRO 6000:n wattiluvut kuvaavat näytönohjaimen teholuokkaa, DGX Sparkin 140 W puolestaan järjestelmäpiiriä. Koko koneen pistorasiakulutus pitää mitata samalla menetelmällä.
Valitse ensin malli, sitten tietokone
Tietokoneen valinta alkaa tarkasta mallitiedostosta. ”Haluan ajaa 70B-mallia” ei vielä kerro, mitä koneelta vaaditaan. Sama malliperhe voi olla tarjolla eri kvantisoinneilla, konteksteilla ja tiedostomuodoilla.
Kirjaa nämä kuusi asiaa ennen laitevertailua:
Mallin tarkka nimi, versio ja arkkitehtuuri
Käytettävä mallitiedosto ja kvantisointi, esimerkiksi GGUF Q4_K_M
Tavoiteltu kontekstipituus
Yksi käyttäjä vai usean käyttäjän paikallinen palvelu
Ajoympäristö, kuten llama.cpp, Ollama, LM Studio, MLX LM tai vLLM
Pakolliset ohjelmistovaatimukset, esimerkiksi CUDA
Jos ensimmäinen kohta on vielä auki, aloita kielimallin valintaoppaasta. Pienempi malli voi voittaa suuremman rajatussa tehtävässä, joten laatu kannattaa testata omalla aineistolla ennen laitebudjetin lukitsemista.
Tiheä malli ja MoE-malli kuormittavat konetta eri tavoin
Tiheä eli dense-malli käyttää jokaisessa tokenissa käytännössä koko verkkoa. Asiantuntijaseosmalli eli Mixture of Experts, MoE, voi aktivoida vain osan asiantuntijoista kerrallaan. Molempien painojen pitää silti tavallisesti mahtua muistiin, vaikka MoE-mallin laskentakuorma tokenia kohti voi olla pienempi.
Tämä näkyy oikeissa testeissä. Framework Desktopin Ryzen AI Max+ 395 -kone tuotti avoimessa Ollama-benchmarkissa tiheällä Llama 70B Q4_K_M -mallilla noin 4,97 tokenia sekunnissa. Samassa testikokonaisuudessa gpt-oss-120B-MoE-malli ylsi noin 33,12 tokeniin sekunnissa. Mallin nimessä näkyvä kokonaisparametrimäärä ei siis ennusta yksin käyttötuntumaa.
Ohjelmisto voi ratkaista valinnan ennen rautaa
CUDAa vaativa työnkulku rajaa laitevalinnan käytännössä NVIDIA-näytönohjaimiin. Macissa MLX voi hyödyntää Applen yhtenäismuistia ja grafiikkasuoritinta. llama.cpp ja Ollama toimivat useilla alustoilla, mutta mallien, kvantisointien ja ominaisuuksien tuki vaihtelee.
Alusta | Tavallinen kiihdytysratkaisu | Tarkista ennen ostoa |
|---|---|---|
NVIDIA-GPU Windowsissa tai Linuxissa | CUDA | GPU-malli, ajuriversio, käyttöjärjestelmä ja ajoympäristön versio |
Apple Silicon -Mac, macOS | Metal, esimerkiksi MLX:n tai MLX LM:n kautta | Mallimuoto, mallille käytettävissä oleva yhtenäismuisti ja tarvittavien ominaisuuksien tuki |
AMD-GPU Windowsissa tai Linuxissa | ROCm/HIP tai Vulkan | Tarkka GPU-malli, ajuriversio, käyttöjärjestelmä ja valittu kiihdytysrajapinta |
Intel Arc -GPU tai ajo pelkällä suorittimella | Intel Arcilla Vulkan tai SYCL, suorittimella ajoympäristön CPU-toteutus | Valitun mallin ja tarvittavien ominaisuuksien toimivuus sekä nopeus käytetyllä ohjelmistoversiolla |
AMD:n erilliset näytönohjaimet, Intel Arc -näytönohjaimet, Windows-kannettavat ja pelkkä CPU-ajo jäivät pääsuositusten ulkopuolelle, koska niistä ei löytynyt kattavaa avointa vertailua, joka olisi tehty samalla protokollalla. Ne voivat silti sopia hyvin. Ennen ostoa juuri valittu laite, ajuri ja ohjelmistoversio pitää testata yhdessä.
Paikallinen inferenssi ei yksin takaa verkkoyhteydetöntä käyttöä. Ollama kertoo, ettei se näe paikallisen ajon kehotteita tai dataa, mutta sen pilvimallit ja verkkohaku käyttävät pilvitoimintoja. Ne voi poistaa käytöstä asetuksella disable_ollama_cloud tai ympäristömuuttujalla OLLAMA_NO_CLOUD=1. Tarkista muiden sovellusten telemetria-, päivitys-, verkkohaku- ja pilviasetukset niiden omista ohjeista.
Helppo graafinen sovellus voi olla aloittelijalle tärkeämpi kuin viimeinen nopeusprosentti. LM Studio Bionic -opas näyttää paikallisen mallin käytännön työnkulun Macilla ja PC:llä.
Paljonko muistia paikallinen kielimalli tarvitsee?
Kvantisointi pienentää mallin painoja. llama.cpp:n dokumentaatiossa Q4_K_M käyttää keskimäärin noin 4,89 bittiä parametria kohti. Tästä saa karkean lähtöarvion, mutta pelkkä painotiedoston koko ei ole koneen kokonaismuistitarve.
Malliluokka | Q4_K_M-painojen karkea koko | Mitä taulukosta puuttuu? |
|---|---|---|
8B | noin 4,9 Gt | KV-välimuisti, laskentapuskurit, ajoympäristö ja käyttövara |
14B | noin 8,6 Gt | Sama lisämuisti, jonka määrä riippuu mallista ja kontekstista |
32B | noin 19,6 Gt | 24 Gt voi riittää lyhyeen ajoon, mutta jokainen 32B-tiedosto ei mahdu |
70B | noin 42,8 Gt | 48 Gt on tapauskohtainen alaraja, ei turvallinen yleissuositus |
200B | noin 122,4 Gt | 128 Gt:n laitteessa käyttövara jää yleensä liian pieneksi tiheälle Q4-mallille |
Käytä ostolaskelman pohjana tätä rakennetta:
Painot + KV-välimuisti + ajoympäristön puskurit + käyttöjärjestelmä + käyttövara
KV-välimuisti säilyttää aiempien tokenien avain- ja arvoesityksiä. Sen koko kasvaa kontekstin mukana. Ollama esimerkiksi kasvattaa muistitarvetta, kun kontekstia pidennetään. Tarkka kasvu riippuu mallin kerroksista, piilodimensiosta, KV-päiden määrästä, tietotyypistä ja samanaikaisten sekvenssien määrästä.
Tiheän 70B Q4 -mallin painot ovat jo noin 42,8 Gt. Yhden 48 Gt:n kortti voi riittää lyhyeen kokeeseen, jos muut muistierät pysyvät pieninä. Pidempi konteksti, suurempi eräkoko ja rinnakkaiset käyttäjät voivat nostaa tarpeen yli 48 gigatavun, joissakin töissä 96-128 gigatavuun tai tätäkin suuremmaksi.
Esimerkki: 70B-malli eri konteksteilla
Llama 3.1:n 70B-mallissa on 80 kerrosta, kahdeksan KV-päätä ja 128 ulottuvuutta päätä kohti. Yhden sekvenssin f16-muotoisen KV-välimuistin karkea lasku on 2 × kerrokset × KV-päät × pään ulottuvuus × tokenit × 2 tavua. Ensimmäinen kerroin 2 tulee avain- ja arvoesityksistä, lopun 2 tavua yhden f16-luvun koosta.
Konteksti, tokenia | Q4_K_M-painot | f16-KV, noin | Painot + KV ennen muita muistieriä |
|---|---|---|---|
8 192 | 42,8 Gt | 2,68 Gt | 45,5 Gt |
32 768 | 42,8 Gt | 10,74 Gt | 53,5 Gt |
131 072 | 42,8 Gt | 42,95 Gt | 85,7 Gt |
Taulukko on Llama 3.1 70B:n arkkitehtuurista johdettu esimerkki, ei yleinen 70B-sääntö. Lisäksi tarvitaan tilaa ajoympäristön puskureille ja käyttövaralle. Yhtenäismuistilaitteessa käyttöjärjestelmäkin käyttää samaa muistia. Erillisellä näytönohjaimella VRAM ja järjestelmämuisti budjetoidaan erikseen. KV-välimuistin kvantisointi voi pienentää tarvetta, jos ajoympäristö tukee sitä ja laatu riittää omaan työhön.
Koko kokoonpano ratkaisee
Osa | Merkitys | Käytännön tarkistus |
|---|---|---|
CPU | Tokenisointi ja aineiston esikäsittely kuormittavat suoritinta. Samoin käy, jos osa mallista ajetaan CPU:lla. | Vältä hidasta suoritinta, jos osa mallista ajetaan sillä näytönohjaimen sijaan |
Järjestelmämuisti | Käyttöjärjestelmä, palvelut ja mallin mahdollinen osittainen CPU-ajo tarvitsevat tilaa | Mitoita RAM käyttöjärjestelmän, palvelujen, CPU:lle jäävien malliosien, KV-välimuistin ja mitatun huippukulutuksen perusteella |
SSD | Mallitiedostot vievät kymmeniä tai satoja gigatavuja | Laske mallitiedostojen, eri kvantisointien, adapterien ja välimuistien yhteiskoko ja lisää käyttövara |
Virta ja jäähdytys | Kiihdyttimen ilmoitettu tehoraja ei kerro koko koneen sähkönkulutusta tai melutasoa | Mitoita virtalähde, kotelo ja jäähdytys koko kokoonpanolle ja mittaa kulutus pistorasiasta |
PCIe-väylä | Usean GPU:n kokoonpano tarvitsee fyysiset paikat, PCIe-kaistat ja ilmavälin | Tarkista emolevyn kaistajako, korttien paksuus, virtaliittimet ja se, miten ajoympäristö jakaa mallin GPU:ille |
Järjestelmän ilmoittama kokonaismuisti ei aina ole kokonaan mallin käytettävissä. Strix Halo -koneissa BIOS ja käyttöjärjestelmä vaikuttavat grafiikalle varattuun osuuteen. Applen yhtenäismuistia jakavat CPU, GPU ja muut järjestelmän osat. NVIDIA-kortilla VRAM on erillinen, mutta mallin osittainen siirtäminen keskusmuistiin hidastaa yleensä ajoa.
Jos termit parametri, token, konteksti ja kvantisointi ovat uusia, 20 AI-käsitteen opas antaa niille yhteisen pohjan.
Nopeusluvut, joihin voi luottaa
”120 tokenia sekunnissa” kuulostaa täsmälliseltä. Luku on käyttökelpoinen vasta, kun tiedät, mitä mitattiin.
Prompt processing eli prefill
Laite käsittelee käyttäjän syötteen ennen vastauksen tuottamista. Pitkä dokumentti tai laaja keskusteluhistoria tekee tästä näkyvän viiveen. Prefill voi olla satoja tai tuhansia tokeneita sekunnissa, vaikka vastaus syntyy paljon hitaammin.
Ensimmäisen tokenin viive
TTFT eli time to first token kertoo, kuinka kauan käyttäjä odottaa vastauksen alkamista. Mittari yhdistää jonotuksen, promptin käsittelyn ja muut palvelimen viiveet. Hyvä generointinopeus ei pelasta käyttökokemusta, jos ensimmäinen token saapuu hitaasti.
Token generation eli decode
Tämä on yhden jatkuvan vastauksen tavallinen tokenia sekunnissa -luku. Toimituksellisena käyttötuntuma-arviona noin 20-30 tokenia sekunnissa tuntuu henkilökohtaisessa tekstikeskustelussa jo ripeältä. Viisi tokenia sekunnissa voi olla hyväksyttävä pitkän analyysin odottelussa, mutta interaktiivinen työ tuntuu hitaalta. Token ei vastaa vakioitua sana- tai merkkimäärää, joten kieli, tokenisaattori ja vastauksen rakenne vaikuttavat kokemukseen.
Kokonaisläpäisy palvelimessa
Usean käyttäjän palvelussa kiinnostaa kaikkien pyyntöjen yhteenlaskettu läpäisy, jonotusaika ja viivejakauma. vLLM:n benchmark-työkalut erottavat nämä mittarit yhden käyttäjän decode-nopeudesta.

Yhden lähteen suuntaa-antava GPU-vertailu
ComputingForGeeks julkaisi kesäkuussa 2026 Ollamalla ajetun vertailun, jossa käytettiin Q4_K_M-malleja, 4 096 tokenin kontekstia ja lämmintä mallia. Luvut ovat hyödyllisiä saman taulukon sisällä:
GPU | Llama 3.1 8B | Qwen2.5 32B | Llama 3.3 70B |
|---|---|---|---|
RTX 3090 24 Gt | 119 tok/s | 37 tok/s | Ei mahtunut |
RTX 4090 24 Gt | 148 tok/s | 43 tok/s | Ei mahtunut |
RTX 5090 32 Gt | 250 tok/s | 71 tok/s | Ei mahtunut |
L40S 48 Gt | 113 tok/s | 33 tok/s | 16 tok/s |
Taulukko havainnollistaa kapasiteetin ja nopeuden eroa yhden lähteen sisällä. RTX 5090 oli tässä testissä nopein Llama 3.1 8B- ja Qwen2.5 32B -malleilla, mutta 48 Gt:n L40S pystyi ajamaan Llama 3.3 70B -testin. Tulosta ei voi yleistää toiseen ajoympäristöön, malliversioon tai kontekstiin. Julkaisu ei myöskään raportoi kaikkia ohjelmistoversioita, toistomääriä, hajontaa ja isäntäkoneen tietoja.
Tarkista benchmarkista nämä kahdeksan asiaa:
Sama tarkka malli ja mallitiedosto
Sama kvantisointi ja tiedostomuoto
Sama kontekstipituus ja syötteen pituus
Sama ajoympäristö sekä näkyvä ohjelmistoversio
Erottelu prompt processingin ja token generationin välillä
Kylmä tai lämmin ajo kerrottu
Toistojen määrä ja tulosten hajonta ilmoitettu
Isäntäkone, muistiasetukset ja mahdollinen CPU-offload kuvattu
NPU:n TOPS-luku ei korvaa tätä listaa. TOPS kertoo tietynlaisesta teoreettisesta laskentakapasiteetista tietyllä tarkkuudella. Se ei kerro, käyttääkö Ollama tai LM Studio juuri sitä NPU:ta, mahtuuko malli muistiin tai kuinka nopeasti valittu mallitiedosto tuottaa tokeneita.
Laiteluokat: NVIDIAsta uusiin Maceihin. Näin valitset itsellesi sopivan tietokoneen ja mallin
Tilaa AI-Sanomien Plus-jäsenyys niin näet loput sisällöstä
Tilaamalla AI-Sanomien maksullisen jäsenyyden saat pääsyn kaikkiin uutiskirjeen sisältöihin sekä tuet Suomen parasta AI-mediaa.
Tilaa jäsenyys tästä! Voit lopettaa koska tahansa.Miksi tilaus kannattaa?:
- Näet kaikki uutiskirjeen sisällöt, uudet AI-työkalut sekä vinkit tekoälyn käyttöön.
- Pääsy kaikkiin verkkokursseihin kurssit.aisanomat.fi-alustassa
- Pääsy Kehotesuunnittelija.fi Premium-tasoon (15 €/kk)
- Pääsy satoihin maksullisiin sisältöihin, oppaisiin ja artikkeleihin

