128 gigatavun mini-PC voi ladata mallin, joka ei mahdu RTX 5090:n 32 gigatavun muistiin. RTX 5090 voi silti tuottaa vastauksen nopeammin silloin, kun malli mahtuu kokonaan näytönohjaimelle. Toteutuva ero riippuu mallista, kontekstista ja ajoympäristöstä.

Siksi paikalliselle kielimallille ei ole yhtä parasta tietokonetta. Valinta ratkeaa kolmella kysymyksellä:

  1. Mahtuuko tarkka mallitiedosto, konteksti ja käyttövara laitteelle?

  2. Tuottaako laite vastauksen riittävän nopeasti?

  3. Sopiiko kone arkeen melun, koon, sähkönkulutuksen, ohjelmistotuen ja hinnan kannalta?

Tämä opas keskittyy paikalliseen inferenssiin eli valmiin mallin käyttämiseen.

Tilanne tarkistettu 29.8.2026. Apple julkisti uudet M6- ja M5 Pro -Mac minit sekä M5 Max- ja M5 Ultra -Mac Studiot 25.8.2026. Toimitukset alkavat 22.9.2026, joten riippumattomat testit myyntilaitteilla ja paikallisilla kielimalleilla puuttuvat vielä. Suomen hinnat ja saatavuus kannattaa tarkistaa ostopäivänä.

Nopea vastaus: mikä kone mihinkin käyttöön?

Käyttötapa

Järkevä lähtökohta

Mitä näyttö kertoo?

Tärkein rajoite

7B-14B-mallit henkilökohtaiseen käyttöön

Nykyinen kohtuullisen uusi Mac tai PC

Pienet kvantisoidut mallit toimivat monella nykykoneella

Uusi ostos voi olla tarpeeton

Kokonaismuistitarve enintään 24 Gt

Käytetty RTX 3090 -kone

Ehdollinen 24 Gt:n arvovaihtoehto, kun koko kokoonpanon Suomen hinta on kilpailukykyinen

Käytetyn kortin kunto, 350 W:n korttiteho ja 24 Gt:n katto

Kokonaismuistitarve yli 24 Gt mutta enintään 32 Gt

RTX 5090 -työasema

ComputingForGeeksin testissä nopein kuluttajakortti Llama 3.1 8B- ja Qwen2.5 32B -malleilla

Tulos ei yleisty kaikkiin malleihin, ja 32 Gt ei riitä tiheälle 70B Q4 -mallille

Tiheä 70B lyhyellä kontekstilla

Vähintään 48 Gt mallille käytettävää nopeaa muistia

Yhden kortin 48 Gt voi riittää tapauskohtaisesti

Pidempi konteksti ja rinnakkaiskuorma voivat nostaa tarpeen 96-128 gigatavuun tai suuremmaksi

Suuri malli kompaktissa koneessa

128 Gt:n Strix Halo -mini-PC

Suuri yhtenäismuisti mahdollistaa 70B- ja joitakin suurempia malleja

Tiheän 70B-mallin generointi voi jäädä noin viiden tokenin sekuntinopeuteen

Suuri malli valmiissa CUDA-pöytälaitteessa

NVIDIA DGX Spark

128 Gt:n muisti ja valmis CUDA-ohjelmistopino

200B-tuki kertoo kapasiteetista, ei yleisestä vastausnopeudesta

70B, pitkä konteksti tai monta käyttäjää

RTX PRO 6000 -luokka tai suunniteltu usean GPU:n työasema

96 Gt yhdellä ammattikortilla helpottaa muistibudjettia

Hinta, 600 W:n teholuokka ja työasemainfrastruktuuri

Suuri muisti macOS-pöytäkoneessa

M5 Pro Mac mini tai M5 Max/M5 Ultra Mac Studio

Muistikatot ovat 64, 128 ja 512 Gt

Riippumaton suorituskykynäyttö puuttuu vielä

Suuri muisti mukana kulkevassa koneessa

M5 Max MacBook Pro

Enintään 128 Gt yhtenäismuistia

Korkea hinta, lämpörajat ja juotettu muisti

Pikalistan tärkein rivi on ensimmäinen. Testaa nykyinen kone ennen ostamista. Paikallinen tekoäly omalla koneella -opas auttaa Ollaman, LM Studion ja muiden tavallisten työkalujen alkuun.

Euromääräinen voittajalista vanhenisi nopeasti. Kokoonpano, arvonlisävero, saatavuus ja käytettyjen näytönohjainten kunto vaikuttavat hintaan enemmän kuin siisti dollarihinnan muunnos antaisi ymmärtää. Vertaa Suomessa toteutuvaa kokonaishintaa vasta, kun sopiva laiteluokka on selvillä.

Taulukon teholuvut eivät ole keskenään suoraan vertailukelpoisia. RTX 3090:n ja RTX PRO 6000:n wattiluvut kuvaavat näytönohjaimen teholuokkaa, DGX Sparkin 140 W puolestaan järjestelmäpiiriä. Koko koneen pistorasiakulutus pitää mitata samalla menetelmällä.

Valitse ensin malli, sitten tietokone

Tietokoneen valinta alkaa tarkasta mallitiedostosta. ”Haluan ajaa 70B-mallia” ei vielä kerro, mitä koneelta vaaditaan. Sama malliperhe voi olla tarjolla eri kvantisoinneilla, konteksteilla ja tiedostomuodoilla.

Kirjaa nämä kuusi asiaa ennen laitevertailua:

  • Mallin tarkka nimi, versio ja arkkitehtuuri

  • Käytettävä mallitiedosto ja kvantisointi, esimerkiksi GGUF Q4_K_M

  • Tavoiteltu kontekstipituus

  • Yksi käyttäjä vai usean käyttäjän paikallinen palvelu

  • Ajoympäristö, kuten llama.cpp, Ollama, LM Studio, MLX LM tai vLLM

  • Pakolliset ohjelmistovaatimukset, esimerkiksi CUDA

Jos ensimmäinen kohta on vielä auki, aloita kielimallin valintaoppaasta. Pienempi malli voi voittaa suuremman rajatussa tehtävässä, joten laatu kannattaa testata omalla aineistolla ennen laitebudjetin lukitsemista.

Tiheä malli ja MoE-malli kuormittavat konetta eri tavoin

Tiheä eli dense-malli käyttää jokaisessa tokenissa käytännössä koko verkkoa. Asiantuntijaseosmalli eli Mixture of Experts, MoE, voi aktivoida vain osan asiantuntijoista kerrallaan. Molempien painojen pitää silti tavallisesti mahtua muistiin, vaikka MoE-mallin laskentakuorma tokenia kohti voi olla pienempi.

Tämä näkyy oikeissa testeissä. Framework Desktopin Ryzen AI Max+ 395 -kone tuotti avoimessa Ollama-benchmarkissa tiheällä Llama 70B Q4_K_M -mallilla noin 4,97 tokenia sekunnissa. Samassa testikokonaisuudessa gpt-oss-120B-MoE-malli ylsi noin 33,12 tokeniin sekunnissa. Mallin nimessä näkyvä kokonaisparametrimäärä ei siis ennusta yksin käyttötuntumaa.

Ohjelmisto voi ratkaista valinnan ennen rautaa

CUDAa vaativa työnkulku rajaa laitevalinnan käytännössä NVIDIA-näytönohjaimiin. Macissa MLX voi hyödyntää Applen yhtenäismuistia ja grafiikkasuoritinta. llama.cpp ja Ollama toimivat useilla alustoilla, mutta mallien, kvantisointien ja ominaisuuksien tuki vaihtelee.

Alusta

Tavallinen kiihdytysratkaisu

Tarkista ennen ostoa

NVIDIA-GPU Windowsissa tai Linuxissa

CUDA

GPU-malli, ajuriversio, käyttöjärjestelmä ja ajoympäristön versio

Apple Silicon -Mac, macOS

Metal, esimerkiksi MLX:n tai MLX LM:n kautta

Mallimuoto, mallille käytettävissä oleva yhtenäismuisti ja tarvittavien ominaisuuksien tuki

AMD-GPU Windowsissa tai Linuxissa

ROCm/HIP tai Vulkan

Tarkka GPU-malli, ajuriversio, käyttöjärjestelmä ja valittu kiihdytysrajapinta

Intel Arc -GPU tai ajo pelkällä suorittimella

Intel Arcilla Vulkan tai SYCL, suorittimella ajoympäristön CPU-toteutus

Valitun mallin ja tarvittavien ominaisuuksien toimivuus sekä nopeus käytetyllä ohjelmistoversiolla

AMD:n erilliset näytönohjaimet, Intel Arc -näytönohjaimet, Windows-kannettavat ja pelkkä CPU-ajo jäivät pääsuositusten ulkopuolelle, koska niistä ei löytynyt kattavaa avointa vertailua, joka olisi tehty samalla protokollalla. Ne voivat silti sopia hyvin. Ennen ostoa juuri valittu laite, ajuri ja ohjelmistoversio pitää testata yhdessä.

Paikallinen inferenssi ei yksin takaa verkkoyhteydetöntä käyttöä. Ollama kertoo, ettei se näe paikallisen ajon kehotteita tai dataa, mutta sen pilvimallit ja verkkohaku käyttävät pilvitoimintoja. Ne voi poistaa käytöstä asetuksella disable_ollama_cloud tai ympäristömuuttujalla OLLAMA_NO_CLOUD=1. Tarkista muiden sovellusten telemetria-, päivitys-, verkkohaku- ja pilviasetukset niiden omista ohjeista.

Helppo graafinen sovellus voi olla aloittelijalle tärkeämpi kuin viimeinen nopeusprosentti. LM Studio Bionic -opas näyttää paikallisen mallin käytännön työnkulun Macilla ja PC:llä.

Paljonko muistia paikallinen kielimalli tarvitsee?

Kvantisointi pienentää mallin painoja. llama.cpp:n dokumentaatiossa Q4_K_M käyttää keskimäärin noin 4,89 bittiä parametria kohti. Tästä saa karkean lähtöarvion, mutta pelkkä painotiedoston koko ei ole koneen kokonaismuistitarve.

Malliluokka

Q4_K_M-painojen karkea koko

Mitä taulukosta puuttuu?

8B

noin 4,9 Gt

KV-välimuisti, laskentapuskurit, ajoympäristö ja käyttövara

14B

noin 8,6 Gt

Sama lisämuisti, jonka määrä riippuu mallista ja kontekstista

32B

noin 19,6 Gt

24 Gt voi riittää lyhyeen ajoon, mutta jokainen 32B-tiedosto ei mahdu

70B

noin 42,8 Gt

48 Gt on tapauskohtainen alaraja, ei turvallinen yleissuositus

200B

noin 122,4 Gt

128 Gt:n laitteessa käyttövara jää yleensä liian pieneksi tiheälle Q4-mallille

Käytä ostolaskelman pohjana tätä rakennetta:

Painot + KV-välimuisti + ajoympäristön puskurit + käyttöjärjestelmä + käyttövara

KV-välimuisti säilyttää aiempien tokenien avain- ja arvoesityksiä. Sen koko kasvaa kontekstin mukana. Ollama esimerkiksi kasvattaa muistitarvetta, kun kontekstia pidennetään. Tarkka kasvu riippuu mallin kerroksista, piilodimensiosta, KV-päiden määrästä, tietotyypistä ja samanaikaisten sekvenssien määrästä.

Tiheän 70B Q4 -mallin painot ovat jo noin 42,8 Gt. Yhden 48 Gt:n kortti voi riittää lyhyeen kokeeseen, jos muut muistierät pysyvät pieninä. Pidempi konteksti, suurempi eräkoko ja rinnakkaiset käyttäjät voivat nostaa tarpeen yli 48 gigatavun, joissakin töissä 96-128 gigatavuun tai tätäkin suuremmaksi.

Esimerkki: 70B-malli eri konteksteilla

Llama 3.1:n 70B-mallissa on 80 kerrosta, kahdeksan KV-päätä ja 128 ulottuvuutta päätä kohti. Yhden sekvenssin f16-muotoisen KV-välimuistin karkea lasku on 2 × kerrokset × KV-päät × pään ulottuvuus × tokenit × 2 tavua. Ensimmäinen kerroin 2 tulee avain- ja arvoesityksistä, lopun 2 tavua yhden f16-luvun koosta.

Konteksti, tokenia

Q4_K_M-painot

f16-KV, noin

Painot + KV ennen muita muistieriä

8 192

42,8 Gt

2,68 Gt

45,5 Gt

32 768

42,8 Gt

10,74 Gt

53,5 Gt

131 072

42,8 Gt

42,95 Gt

85,7 Gt

Taulukko on Llama 3.1 70B:n arkkitehtuurista johdettu esimerkki, ei yleinen 70B-sääntö. Lisäksi tarvitaan tilaa ajoympäristön puskureille ja käyttövaralle. Yhtenäismuistilaitteessa käyttöjärjestelmäkin käyttää samaa muistia. Erillisellä näytönohjaimella VRAM ja järjestelmämuisti budjetoidaan erikseen. KV-välimuistin kvantisointi voi pienentää tarvetta, jos ajoympäristö tukee sitä ja laatu riittää omaan työhön.

Koko kokoonpano ratkaisee

Osa

Merkitys

Käytännön tarkistus

CPU

Tokenisointi ja aineiston esikäsittely kuormittavat suoritinta. Samoin käy, jos osa mallista ajetaan CPU:lla.

Vältä hidasta suoritinta, jos osa mallista ajetaan sillä näytönohjaimen sijaan

Järjestelmämuisti

Käyttöjärjestelmä, palvelut ja mallin mahdollinen osittainen CPU-ajo tarvitsevat tilaa

Mitoita RAM käyttöjärjestelmän, palvelujen, CPU:lle jäävien malliosien, KV-välimuistin ja mitatun huippukulutuksen perusteella

SSD

Mallitiedostot vievät kymmeniä tai satoja gigatavuja

Laske mallitiedostojen, eri kvantisointien, adapterien ja välimuistien yhteiskoko ja lisää käyttövara

Virta ja jäähdytys

Kiihdyttimen ilmoitettu tehoraja ei kerro koko koneen sähkönkulutusta tai melutasoa

Mitoita virtalähde, kotelo ja jäähdytys koko kokoonpanolle ja mittaa kulutus pistorasiasta

PCIe-väylä

Usean GPU:n kokoonpano tarvitsee fyysiset paikat, PCIe-kaistat ja ilmavälin

Tarkista emolevyn kaistajako, korttien paksuus, virtaliittimet ja se, miten ajoympäristö jakaa mallin GPU:ille

Järjestelmän ilmoittama kokonaismuisti ei aina ole kokonaan mallin käytettävissä. Strix Halo -koneissa BIOS ja käyttöjärjestelmä vaikuttavat grafiikalle varattuun osuuteen. Applen yhtenäismuistia jakavat CPU, GPU ja muut järjestelmän osat. NVIDIA-kortilla VRAM on erillinen, mutta mallin osittainen siirtäminen keskusmuistiin hidastaa yleensä ajoa.

Jos termit parametri, token, konteksti ja kvantisointi ovat uusia, 20 AI-käsitteen opas antaa niille yhteisen pohjan.

Nopeusluvut, joihin voi luottaa

”120 tokenia sekunnissa” kuulostaa täsmälliseltä. Luku on käyttökelpoinen vasta, kun tiedät, mitä mitattiin.

Prompt processing eli prefill

Laite käsittelee käyttäjän syötteen ennen vastauksen tuottamista. Pitkä dokumentti tai laaja keskusteluhistoria tekee tästä näkyvän viiveen. Prefill voi olla satoja tai tuhansia tokeneita sekunnissa, vaikka vastaus syntyy paljon hitaammin.

Ensimmäisen tokenin viive

TTFT eli time to first token kertoo, kuinka kauan käyttäjä odottaa vastauksen alkamista. Mittari yhdistää jonotuksen, promptin käsittelyn ja muut palvelimen viiveet. Hyvä generointinopeus ei pelasta käyttökokemusta, jos ensimmäinen token saapuu hitaasti.

Token generation eli decode

Tämä on yhden jatkuvan vastauksen tavallinen tokenia sekunnissa -luku. Toimituksellisena käyttötuntuma-arviona noin 20-30 tokenia sekunnissa tuntuu henkilökohtaisessa tekstikeskustelussa jo ripeältä. Viisi tokenia sekunnissa voi olla hyväksyttävä pitkän analyysin odottelussa, mutta interaktiivinen työ tuntuu hitaalta. Token ei vastaa vakioitua sana- tai merkkimäärää, joten kieli, tokenisaattori ja vastauksen rakenne vaikuttavat kokemukseen.

Kokonaisläpäisy palvelimessa

Usean käyttäjän palvelussa kiinnostaa kaikkien pyyntöjen yhteenlaskettu läpäisy, jonotusaika ja viivejakauma. vLLM:n benchmark-työkalut erottavat nämä mittarit yhden käyttäjän decode-nopeudesta.

Yhden lähteen suuntaa-antava GPU-vertailu

ComputingForGeeks julkaisi kesäkuussa 2026 Ollamalla ajetun vertailun, jossa käytettiin Q4_K_M-malleja, 4 096 tokenin kontekstia ja lämmintä mallia. Luvut ovat hyödyllisiä saman taulukon sisällä:

GPU

Llama 3.1 8B

Qwen2.5 32B

Llama 3.3 70B

RTX 3090 24 Gt

119 tok/s

37 tok/s

Ei mahtunut

RTX 4090 24 Gt

148 tok/s

43 tok/s

Ei mahtunut

RTX 5090 32 Gt

250 tok/s

71 tok/s

Ei mahtunut

L40S 48 Gt

113 tok/s

33 tok/s

16 tok/s

Taulukko havainnollistaa kapasiteetin ja nopeuden eroa yhden lähteen sisällä. RTX 5090 oli tässä testissä nopein Llama 3.1 8B- ja Qwen2.5 32B -malleilla, mutta 48 Gt:n L40S pystyi ajamaan Llama 3.3 70B -testin. Tulosta ei voi yleistää toiseen ajoympäristöön, malliversioon tai kontekstiin. Julkaisu ei myöskään raportoi kaikkia ohjelmistoversioita, toistomääriä, hajontaa ja isäntäkoneen tietoja.

Tarkista benchmarkista nämä kahdeksan asiaa:

  • Sama tarkka malli ja mallitiedosto

  • Sama kvantisointi ja tiedostomuoto

  • Sama kontekstipituus ja syötteen pituus

  • Sama ajoympäristö sekä näkyvä ohjelmistoversio

  • Erottelu prompt processingin ja token generationin välillä

  • Kylmä tai lämmin ajo kerrottu

  • Toistojen määrä ja tulosten hajonta ilmoitettu

  • Isäntäkone, muistiasetukset ja mahdollinen CPU-offload kuvattu

NPU:n TOPS-luku ei korvaa tätä listaa. TOPS kertoo tietynlaisesta teoreettisesta laskentakapasiteetista tietyllä tarkkuudella. Se ei kerro, käyttääkö Ollama tai LM Studio juuri sitä NPU:ta, mahtuuko malli muistiin tai kuinka nopeasti valittu mallitiedosto tuottaa tokeneita.

Laiteluokat: NVIDIAsta uusiin Maceihin. Näin valitset itsellesi sopivan tietokoneen ja mallin

logo

Tilaa AI-Sanomien Plus-jäsenyys niin näet loput sisällöstä

Tilaamalla AI-Sanomien maksullisen jäsenyyden saat pääsyn kaikkiin uutiskirjeen sisältöihin sekä tuet Suomen parasta AI-mediaa.

Tilaa jäsenyys tästä! Voit lopettaa koska tahansa.

Miksi tilaus kannattaa?:

  • Näet kaikki uutiskirjeen sisällöt, uudet AI-työkalut sekä vinkit tekoälyn käyttöön.
  • Pääsy kaikkiin verkkokursseihin kurssit.aisanomat.fi-alustassa
  • Pääsy Kehotesuunnittelija.fi Premium-tasoon (15 €/kk)
  • Pääsy satoihin maksullisiin sisältöihin, oppaisiin ja artikkeleihin