A 6 legjobb kínai AI-modell 2026 nyarán! Kínai AI teszt 2026: Melyik AI-t érdemes használnia?
2026 közepére a kínai mesterséges intelligencia modellek nemcsak utolérték, hanem számos területen meg is előzték a nyugati versenytársaikat - töredék áron. A Central PC-nél hónapok óta napi szinten teszteljük őket éles környezetben: az OpenClaw autonóm ágens-keretrendszerben és az OpenWebUI chat felületen egyaránt. Hat modellt vizsgáltunk meg alaposan: DeepSeek V4 Pro, Kimi K2.7 Code, Qwen 3.7 Max, Qwen 3.7 Plus, MiniMax M3, GLM 5.2, és az eredmények meglepőek voltak. Vannak köztük olyanok, amelyek több mint 20-szorosával olcsóbbak a Claude Opusnál, mégis felveszik vele a versenyt kódolásban és komplex ágensfeladatokban. Ebben a cikkben nem gyártói marketinganyagot közlünk, hanem azt, amit valóban tapasztaltunk: melyik modell mire jó, melyikben nem lehet megbízni, és melyiket használjuk ma is minden nap.
1. Bevezető - az AI architektúrák átalakulása és a kínai modellek térnyerése
Hogyan olvassa ezt a cikket? Ebben a cikkben olyan szakmai kifejezések is szerepelnek, amelyeket a mesterséges intelligencia világában gyakran angolul használnak. Ahol szükségesnek látjuk, rövid magyarázatot adunk hozzájuk szürke hátterű dobozokban. A márkanevek, modellnevek természetesen változatlanok maradnak. A pontos API árak gyakorlatilag naponta változnak, ez függ akcióktól, szolgáltatóktól, ezért ezek csak tájékoztató jellegűek!

2026: az autonóm ágensek éve
2026 első felében a nagy nyelvi modellek használata alapvetően megváltozott. A korábbi években a modellek főként szövegek írására és egyszerű kérdés-válasz feladatokra szolgáltak. Most azonban az autonóm ágensek kerültek előtérbe: olyan mesterséges intelligenciák, amelyek önállóan terveznek, eszközöket használnak, fájlrendszert kezelnek, és akár órákon át tartó munkafolyamatokat menedzselnek emberi beavatkozás nélkül.
Mi az az autonóm ágens? Egy olyan mesterséges intelligencia-rendszer, amely nemcsak válaszol a kérdésekre, hanem célokat kap, és önállóan hajtja végre a szükséges feladatokat. Például képes fájlokat létrehozni, időzített feladatokat futtatni, hibákat javítani, vagy akár több lépésből álló munkafolyamatokat önállóan végigvinni.
A gyakorlatban: egy hagyományos modell válaszol a kérdésre. Egy autonóm ágens meg is csinálja a feladatot - fájlt ment, ütemezett feladatot állít be, konfigurációs hibát javít, és ha elakad, megkeresi a megoldást.
A kínai modellek ebben a térben nem csupán olcsó alternatívák (bár az áruk valóban alacsony), hanem a terminál-alapú ágensfeladatokban, a költséghatékonyságban és a nyílt súlyú elérhetőségben piacvezető pozícióba kerültek. Ez a cikk hat meghatározó kínai modellt mutat be mérési eredményekkel, árakkal és a Central PC-nél szerzett gyakorlati tapasztalatokkal.
Az Anthropic (Claude) API árazás és ami mögötte van
A Central PC-nél a váltást végül az ár döntötte el. A Claude Opus kimeneti ára ($25.00/1 millió token) és az API használatának alapköltsége egy folyamatosan futó autonóm ágens esetén hónapról hónapra tarthatatlanná vált - különösen azután, hogy 2026 tavaszán egymás után érkeztek a töredék áron elérhető kínai modellek.
Mi az az API? Az API (Application Programming Interface) egy programozói kapcsolódási felület, amelyen keresztül egy szoftver automatikusan kommunikálhat egy másik szolgáltatással - jelen esetben egy nyelvi modellel. Gyakorlatilag ez az a csatorna, amin keresztül az OpenClaw vagy az OpenWebUI „beszélget” a modellekkel.
A Central PC-nél ekkor kezdtük el komolyan vizsgálni a kínai modelleket. Nem politikai okokból, hanem azért, mert a napi automatizált feladataink során a Claude Opus költségei vállalhatatlanná váltak. 2026 februárja és júniusa között pedig egymás után érkeztek az új kínai modellek, amelyek számos területen megelőzték nyugati versenytársaikat.

A DeepSeek V4 Pro árcsökkentése
2026. április 24-én a DeepSeek bejelentette a V4 Pro modellt, és vele egy 75%-os, tartós árcsökkentést. A modell ára $0.435/$0.87-en állandósult (bemenet/kimenet, 1 millió tokenenként) - ez a modell induláskor publikált listaárának negyede. Ez a Claude Opus 4.8 kimeneti árának ($25.00/1 millió) kevesebb mint huszad része.
Mi az a token? A token a nyelvi modellek legkisebb feldolgozási egysége. Nagyjából egy szó 1-1,5 tokent jelent, de a magyar toldalékok (például -ban, -ból) gyakran külön tokent kapnak. A modellek árazását és a kontextusablak méretét is tokenben mérik. Például 1 millió token körülbelül 700 000-750 000 magyar szónak felel meg.
Az OpenClaw keretrendszer, OpenWebUI hagyományos chat felület
A Central PC-nél az OpenClaw nyílt súlyú ágens-keretrendszert használjuk az autonóm AI-munkafolyamatokhoz. Ez nem chat-felület: folyamatosan fut, saját memóriája van, ütemezett feladatokat futtat, fájlrendszert kezel, segédágenseket (subagent folyamatokat) indít, és több modellt váltogat a feladat nehézsége szerint. A hagyományos, webes felületen történő közvetlen modell-interakcióra pedig az OpenWebUI saját gépen futtatható chat felületet használjuk. Ez hasonló, mint a ChatGPT vagy Gemini felülete, csak jóval több modellt lehet egy böngészőből használni, van saját memória és egyedi munkaterület kialakítására lehetőség, akár modellenként is.
Mi az a nyílt súlyú modell? A modell „súlyai” azok a tanult értékek, amelyek meghatározzák, hogyan válaszol a modell. Ha egy modell nyílt súlyú, ezek az értékek letölthetők, és saját számítógépen vagy szerveren is futtatható a modell. Ez függetlenséget és átláthatóságot biztosít - nem kell egyetlen külső cég szerveréhez kötni magunkat.

A hat vizsgált modell
Az alábbiakban hat kínai nagy nyelvi modellt elemzünk, amelyek 2026 júniusában a legmeghatározóbbak az autonóm ágens-ökoszisztémában:
Nyílt súlyú, 1 millió token kontextus, 384 ezer token kimenet, tartós árcsökkentés
Kimi Codex terminál alapú kódolási ágens, vizuális kódolás, közvetlen IDE-helyettesítés
Zárt modell, SWE-bench Pro rekorder, GPQA 92.4%
Zárt modell, natív szöveg/kép/videó bemenet, 1 millió token kontextus, MoE alapú, 80B aktív paraméter.
Legolcsóbb csúcskategóriás modell (promóciós ár: $0.30/$1.20), 1 millió token kontextus
1 millió token kontextus (5× növekedés az előző generációhoz képest), kétféle gondolkodási mód (lite/max), MIT licenc
Referenciaként bevonunk három nyugati modellt is: GPT-5.5 (OpenAI), Claude Opus 4.8 (Anthropic) és Gemini 3.5 Flash (Google). A cél nem a „kínai vs. nyugati” szembenállás, hanem annak bemutatása, hogy 2026 közepére a választás már nem földrajzi, hanem funkcionális - egy kkv számára pedig anyagi kérdés.

2. Architektúra és alapvető képességek
2026 közepére a kínai modellek architekturális újításai (mint a MoE és az MLA) olyan hatékonyságot tettek lehetővé, ami néhány éve még elképzelhetetlennek tűnt volna. Az alábbiakban mind a hat modellt részletesen megvizsgáljuk és teszteljük, az alapvető architektúrától kezdve egészen a gyakorlati alkalmazhatóságig.
Mi az a kontextusablak? A kontextusablak azt határozza meg, hogy a modell egyszerre mennyi szöveget képes figyelembe venni. Ha például egy modell kontextusablaka 1 millió token, akkor egyszerre feldolgozhat egy hosszú dokumentumot, egy teljes kódbázist vagy több ezer soros naplófájlt anélkül, hogy darabolni kellene a bemenetet.

DeepSeek V4 Pro
A DeepSeek V4 Pro 2026. április 24-én jelent meg, és mára a nyílt súlyú MI-modellek egyik legfontosabb szereplője lett.
Architektúra: A rendszer alapját egy MoE (Mixture of Experts) architektúra adja, amely 1,6 billió teljes és 49 milliárd aktív paraméterrel dolgozik. A modellt hibrid attention (MLA és sparse attention), 1 millió tokenes kontextusablak, valamint 384 ezer tokenes maximális kimeneti kapacitás jellemzi. A modell súlyai MIT licenc alatt nyilvánosan elérhető.
Mi az a paraméter? A paraméter a modell tanult „súlya”, amely meghatározza, hogyan válaszol egy adott bemenetre. Minél több paraméter van egy modellben, általában annál komplexebb összefüggéseket képes megtanulni - de a több paraméter önmagában nem jelent jobb minőséget, ha a modell nem hatékony.
Mi az a MoE (Mixture of Experts)? A „MoE (Mixture of Experts)” elnevezésű architektúrában a modellnek csak egy kis része aktiválódik minden feladatnál. A többi rész alvó állapotban marad, ami drasztikusan csökkenti a futtatási költséget anélkül, hogy a modell teljesítménye romlana. Ez teszi lehetővé például, hogy a DeepSeek V4 Pro ilyen alacsony áron működjön.
Elérhetőség: OpenRouter, DeepSeek Platform, Ollama Cloud stb.; webchat: chat.deepseek.com; natív iOS/Android alkalmazás; saját futtatás MIT licenc alatt.
- Verhetetlen ár-teljesítmény arány - $0.435/$0.87
- Nyílt súlyú (MIT) - auditálható, saját futtatás
- 384 ezer token maximális kimenet - darabolás nélküli hosszú dokumentumok
- LiveCodeBench 93.5%
- Stabil API, 1 millió token kontextus
- Van mobilalkalmazás
- Utasításkövetési mérés (IFEval) eredménye nem publikált
- Adatbiztonsági aggályok - szerverek kínai adatközpontokban
- A Flash változat gyengébb komplex érvelésben
- GPU-igényes saját futtatás

Kimi K2.7 Code
A Moonshot AI Kimi K2.7 Code-ja 2026. június 12-én érkezett, és a Kimi Codex terminál alapú kódolási ágens zászlóshajója.
Architektúra: MoE, 1 billió teljes és 32 milliárd aktív paraméterrel, 384 expert (8 aktív + 1 közös). MLA + SwiGLU, 256 ezer token kontextus. A Moonshot saját mérése szerint 21,8%-os kódolási javulás az előző generációhoz képest, 30%-kal kevesebb thinking token.
Mi az a thinking token? A thinking tokenek azok a belső lépések, amelyeket a modell a végleges válasz előtt generál, amikor összetett problémán dolgozik. Minél több ilyen token kell, annál lassabb és drágább a modell használata. A Kimi K2.7 Code ebből a szempontból javított az elődjéhez képest.
Elérhetőség: OpenRouter, Moonshot API stb.; webchat: kimi.com; iOS/Android alkalmazás; Kimi Codex parancssori felület; Modified MIT licenc.
- Kimi Codex terminál alapú kódolási ágens 15+ eszközhívással
- Vizuális kódolás képernyőképből, Figma designból
- Nyílt súlyú (Modified MIT)
- IDE integráció: Claude Code, Cline, RooCode, OpenCode
- Van mobilalkalmazás
- SWE-bench Pro és Terminal-Bench eredmény nem publikált
- Utasításkövetési mérés (IFEval) nem publikált
- 256 ezer token kontextus kisebb a versenytársakénál

Qwen 3.7 Max
Az Alibaba Cloud Qwen 3.7 Max-e 2026. május 20-án jelent meg, és jelenleg a zárt kínai modellek csúcsát képviseli.
Jellemzők: Hybrid attention + MoE, 1 millió token kontextus, SWE-bench Pro 60.6%, GPQA Diamond 92.4%. A 35 órás autonóm futási rekordja kivételes stabilitást mutat.
Mi az a zárt modell? Egy zárt modellnél a súlyok nem letölthetők, és csak a gyártó saját szerverein vagy API-ján keresztül használható. Ez egyszerűbbé teszi a használatot, de függőséget is jelent a szolgáltatóhoz - ha ő korlátoz vagy leáll, nincs alternatíva.
Elérhetőség: OpenRouter, DashScope, Ollama Cloud stb. - $2.50/$7.50; webchat: chat.qwen.ai; zárt súlyok.
- SWE-bench Pro 60.6% - zárt modellek rekordere
- GPQA Diamond 92.4%
- 1 millió token kontextus
- 35 óra autonóm futás rekord
- API-only, zárt
- Drága - $2.50/$7.50
- Biztonsági korlátozások figyelmen kívül hagyása
- Hibás következtetési hurkok
- Nincs mobilalkalmazás

Qwen 3.7 Plus
A Qwen 3.7 Plus 2026. június 1-jén érkezett, a család multimodális, zárt súlyú tagja. Az Alibaba Apache 2.0 licencet ígért (a végleges feltételek a cikk írásakor még nem voltak véglegesek).
Jellemzők: Natív szöveg/kép/videó bemenet, 1 millió token kontextus, MoE alapú, 80B aktív paraméter.
Elérhetőség: OpenRouter, DashScope, Ollama Cloud stb. - $0.32/$1.28 webchat: chat.qwen.ai; zárt súlyok.
Mi az a multimodális modell? Egy multimodális modell nemcsak szöveget, hanem képeket, videókat vagy akár hangot is képes értelmezni és feldolgozni. Például egy képernyőképet beadva kérhetjük tőle, hogy írja meg a hozzá tartozó weboldal kódját.
- Kiváló ár-érték arány segédágens feladatokra
- Natív multimodális bemenet
- Apache 2.0 licenc ígért (jelenleg zárt súlyú)
- Megbízható jól körülhatárolt feladatokban
- Kevés publikált mérési eredmény
- Biztonsági korlátozások figyelmen kívül hagyása
- Korlátlanul hajlamos hibás következtetési hurkokba kerülni
- Nincs mobilalkalmazás

MiniMax M3
A MiniMax M3 2026. június 1-jén jelent meg, és azonnal a legolcsóbb csúcskategóriás modell lett a piacon.
Architektúra: MSA, Multi-head Sparse Attention + MoE. Csak a releváns szópárokra számol súlyokat (sparse attention), ami alacsonyabb költséget és jobb hosszú távú fókuszt eredményez.
Jellemzők: 1 millió token kontextus, nyílt súlyú, natív multimodális, SWE-bench Verified 80.5%, BrowseComp 83.5%, promóciós ár jelenleg: $0.30/$1.20, alap listaár $0.60/$2.40.
Mi az a sparse attention? A hagyományos modellek minden szóhoz viszonyítanak minden más szót - ez nagyon számításigényes. A sparse attention csak a valóban fontos kapcsolatokat számolja ki, így gyorsabb és olcsóbb, ráadásul hosszú szövegeknél gyakran pontosabb is.
- $0.30/$1.20 - a legolcsóbb csúcskategóriás modell
- SWE-bench Verified 80.5%
- 1 millió token kontextus sparse attention
- Nyílt súlyú, natív multimodális
- BrowseComp 83.5%
- GPQA és utasításkövetési mérés nem publikált
- Időnként ázsiai írásjelek szúródnak a kimenetbe
- Nincs mobilalkalmazás
- 500 ezer token után a figyelem hatékonysága csökken

GLM 5.2
A Zhipu AI (Tsinghua Egyetem spin-off) GLM 5.2-je 2026. június 13-án jelent meg, és rögtön a Terminal-Bench világrekorderévé vált (gyártói adat, független mérés még nem érhető el).
Architektúra: MoE, 744 milliárd teljes és 40 milliárd aktív paraméterrel, 1 millió token kontextus (5-szörös növekedés az előző generációhoz képest), 131 ezer token maximális kimenet, kétféle gondolkodási mód (lite/max).
Elérhetőség: OpenRouter - $1.40/$4.40; webchat: chat.z.ai; MIT licenc; nincs mobilalkalmazás.
- Terminal-Bench 2.1 81.0% - gyártói adat (független mérés folyamatban)
- SWE-bench Pro 62.1%
- Hosszú távú ágensfeladatokban kiváló
- Kétféle gondolkodási mód (gyors/alapos)
- MIT nyílt súlyú
- Nincs független benchmark - csak gyártói belső tesztek
- GPQA és utasításkövetési mérés nem publikált
- Nincs mobilalkalmazás
- „Ellenőrzés nélküli felülírás” probléma
- Lassú első token válaszidő
- Nem multimodális
A Flash változatok és a könnyű modellek szerepe
A cikk fókuszában a „nagy” modellek állnak, de érdemes egy pillantást vetni a kisebb, olcsóbb változatokra is.
DeepSeek V4 Flash: A Pro kisebb testvére, ugyanazt az architektúrát használja, de kevesebb aktív paraméterrel. Ára ~$0.14/$0.28 (OpenRouter fizetős tier), illetve ingyenes szinten is elérhető. A Flash ideális olyan feladatokra, ahol a sebesség és az alacsony költség fontosabb a maximális pontosságnál - például valós idejű chat alkalmazásokban, egyszerű szövegosztályozásban vagy gyors prototípus-készítésnél. A Central PC-nél a Flash-t ritkán használjuk (maximum időzített Cron feladatokhoz), mert az OpenClaw-ban a pontosság fontosabb, mint a sebesség, de egy chatbot alkalmazásban vagy ügyfélszolgálati rendszerben kiváló választás lehet.
A „fordított” skálázás jelensége: Érdekes módon a kínai modelleknél gyakran a nagyobb modell az olcsóbb token kimenetre vetítve. A DeepSeek V4 Pro $0.87/1 millió kimeneti ára alacsonyabb, mint sok kisebb modellé - ennek oka, hogy a MoE architektúra a nagyobb modelleknél hatékonyabban skálázódik. A gyakorlatban ez azt jelenti, hogy nincs okunk kisebb modellt használni pusztán költségmegfontolásból - a nagy modellek gyakran olcsóbbak és jobbak is.
3. Kódolás és szoftvermérnöki képességek
A kódolási képességek mérik a modellek valódi használhatóságát autonóm ágens környezetben. Egy modell lehet kiváló esszéíró vagy fordító, de ha nem tud megbízhatóan kódot generálni és hibákat javítani, az ágens-ökoszisztémában korlátozott a haszna.
A teljesítménymérő tesztek rövid ismertetése
Mielőtt a számokra térnénk, érdemes tisztázni, hogy pontosan mit mérnek ezek a mérések:
Mi az a teljesítménymérő teszt (benchmark)? Egy szabványosított feladatsor, amellyel a modellek képességeit objektíven, számszerűen lehet összehasonlítani. Olyan, mint egy középiskolai érettségi - minden modell ugyanazt a feladatot kapja, és a pontszámok alapján lehet összemérni őket.
- SWE-bench Verified: Valós GitHub hibajegyek alapján mér, hogy a modell megtalálja-e és kijavítja-e a hibát. Emberi szakértők ellenőrizik a teszteket.
- SWE-bench Pro: A Verified nehezített változata - többlépéses, több fájlt érintő javításokat igényel. A 60% feletti eredmény már kiemelkedő.
- Terminal-Bench 2.0/2.1: Parancssor-használatot mér: parancsok kiadása, fájlrendszer-műveletek, csomagtelepítés, verziókezelés, beállításszerkesztés. Autonóm ágensek szempontjából kritikus.
- LiveCodeBench: Versenyszerű programozási feladatok - algoritmusok, adatszerkezetek, optimalizálás. Folyamatosan frissül, így nem lehet a modelleket betanítani rá.
- GPQA Diamond: Doktori szintű tudományos kérdések fizikából, kémiából, biológiából. A válasz nem kereshető ki egyszerűen.
Kódolási mérési eredmények táblázata
| Modell | SWE-bench Verified | SWE-bench Pro | Terminal-Bench 2.0/2.1 | LiveCodeBench | GPQA Diamond |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | 80.6% | 55.4% | 67.9% (TB 2.0) | 93.5% | 90.1% |
| Kimi K2.7 Code | 78.2% | - | - (K2.6: 66.7%) | - | ~75% |
| Qwen 3.7 Max | 80.4% | 60.6% | 69.7% (TB 2.0) | - | 92.4% |
| Qwen 3.7 Plus | - | - | - | - | - |
| MiniMax M3 | 80.5% | 59.0% | 66.0% (TB 2.1) | - | - |
| GLM 5.2 | ~77.8% | 62.1% | 81.0% (TB 2.1) | - | - (5.1: 86.2%) |
| GPT-5.5 (ref.) | 82.6% | 58.6% | ~60% | ~90% | ~91% |
| Claude Opus 4.8 (ref.) | 88.6% | ~57% | 74.6% | ~88% | ~92% |
| Gemini 3.5 Flash (ref.) | 75.8% | - | - | - | - |
Részletes elemzés
Terminal-Bench: A DeepSeek V4 Pro 67.9%-a és a MiniMax M3 66.0%-a jelentősen meghaladja a nyugati teljesítményt (~55-60%). A GLM 5.2 gyártói adata 81.0%, de ez egyelőre független méréssel nem igazolt. Mivel egy autonóm ágens folyamatosan parancssori parancsokat ad ki, ez a különbség hosszú munkafolyamatok során meghatározó mértékben befolyásolja a megbízhatóságot.
SWE-bench Pro: A Qwen 3.7 Max (60.6%) megelőzi a nyugati modelleket. A GLM 5.2 adata egyelőre csak gyártói közlésből érhető el. Ez komplex, valós szoftvermérnöki feladatokban ad versenyelőnyt.
LiveCodeBench: A DeepSeek V4 Pro 93.5%-a a legjobb a mezőnyben, megelőzve még a GPT-5.5 ~90%-át is. Ez versenyszerű programozási feladatokban, algoritmikus gondolkodásban mutat erősséget.
Ár-teljesítmény: A MiniMax M3 80.5%-os SWE-bench Verified eredménye gyakorlatilag megegyezik a DeepSeek V4 Pro 80.6%-ával, ám az M3 ára kevesebb mint harmada a DeepSeeknek.
Szakértői tipp: A mérési eredmények futtatásonként ingadoznak a modellek véletlenszerű jellege miatt. A publikált számok általában a legjobb futtatás eredményei, nem az átlag - a gyakorlati teljesítmény változó lehet.
4. Költséghatékonyság és OpenRouter ár-összehasonlítás
Autonóm ágens rendszerekben a költség kritikus tényező. Egy folyamatosan futó ágens naponta tízezres vagy százezres tokenszámot használ, ami hónapok alatt jelentős költséggé duzzad.
OpenRouter ár táblázat (2026. június)
| Modell | Bemenet ($/1M token) | Kimenet ($/1M token) | Gyorsítótárazott bemenet ($/1M) | Kontextusablak |
|---|---|---|---|---|
| MiniMax M3 | $0.30 | $1.20 | $0.06 | 1M |
| Qwen 3.7 Plus | $0.32 | $1.28 | $0.08 | 1M |
| DeepSeek V4 Pro | $0.435 | $0.87 | $0.044 | 1M |
| Kimi K2.7 Code | $0.74 | $3.50 | $0.19 | 256K |
| GLM 5.2 | $1.40 | $4.40 | $0.26 | 1M |
| Qwen 3.7 Max | $2.50 | $7.50 | $0.25 | 1M |
| GPT-5.5 (ref.) | $3.75 | $15.00 | - | 256K |
| Claude Opus 4.8 (ref.) | $5.00 | $25.00 | - | 200K |
| Gemini 3.5 Flash (ref.) | $1.50 | $9.00 | - | 1M |
Mit jelentenek a számok?
A DeepSeek V4 Pro közel 29-szer olcsóbb kimenetben, mint a Claude Opus 4.8 ($0.87 vs. $25.00/1 millió token). Egy átlagos, napi 200 ezer bemeneti és 30 ezer kimeneti tokent használó OpenClaw működéssel:
- DeepSeek V4 Pro havi költség: ~$3.39/hó
- Claude Opus 4.8 havi költség: ~$52.50/hó
A különbség havonta közel $50, éves szinten több mint $600.
A DeepSeek V4 Pro drasztikus árcsökkentése ($0.435/$0.87) 2026 legnagyobb piaci sokkja. A legtöbb mérésben versenyképes vagy jobb teljesítményt nyújt, mint a jelentősen drágább nyugati modellek.
A gyorsítótárazott bemenet rejtett megtakarítást jelent. A DeepSeek V4 Pro $0.044/1 millió gyorsítótárazott bemeneti ára a normál bemenet tizede. Az ismétlődő rendszerutasítások és a hosszú memóriafájlok így töredék áron futnak.
Mi az a gyorsítótárazott bemenet? Ha egy modellnek ugyanazt a hosszú szöveget (például a rendszerutasításokat vagy a személyiségleírást) minden egyes kérésnél újra el kellene olvasnia, az sokba kerülne. A gyorsítótárazott bemenet azt jelenti, hogy ezeket a részeket a szolgáltató eltárolja, és csak töredék árat számol értük.

Egy hónap OpenClaw működés költsége
Felhasználás: 6 millió bemeneti token, 900 ezer kimeneti token, ebből 4 millió gyorsítótárazott bemenet.
| Modell | Bemenet | Gyorsítótárazott | Kimenet | Havi összesen |
|---|---|---|---|---|
| MiniMax M3 | $0.60 | $0.24 | $1.08 | $1.92 |
| Qwen 3.7 Plus | $0.64 | $0.32 | $1.15 | $2.11 |
| DeepSeek V4 Pro | $0.87 | $0.18 | $0.78 | $1.83 |
| GLM 5.2 | $2.80 | $1.04 | $3.96 | $7.80 |
| Kimi K2.7 Code | $1.48 | $0.76 | $3.15 | $5.39 |
| Qwen 3.7 Max | $5.00 | $1.00 | $6.75 | $12.75 |
| GPT-5.5 | $7.50 | - | $13.50 | $21.00 |
| Claude Opus 4.8 | $10.00 | - | $22.50 | $32.50 |

5. API-only, webchat vagy mobilalkalmazás
A modellek elérhetősége alapvetően meghatározza, hogy hogyan és mire használhatjuk őket. Sokan ragaszkodnak a mobilos eléréshez. Egy modell lehet bármilyen kiváló a mérések szerint, ha az adott felhasználási módhoz nem elérhető.
Elérhetőségi táblázat
| Modell | Programozói felület | Nyílt súlyú | Mobilalkalmazás | Webchat |
|---|---|---|---|---|
| DeepSeek V4 Pro | OpenRouter, DeepSeek Platform | MIT | iOS + Android | chat.deepseek.com |
| Kimi K2.7 Code | OpenRouter, Moonshot API | Modified MIT | iOS + Android | kimi.com |
| Qwen 3.7 Max | OpenRouter, DashScope | Zárt | - | chat.qwen.ai |
| Qwen 3.7 Plus | OpenRouter, DashScope | Apache 2.0 (ígért) | - | chat.qwen.ai |
| MiniMax M3 | OpenRouter | Nyílt súlyú | - | hailuoai.com |
| GLM 5.2 | OpenRouter | MIT | - | chat.z.ai |
Elemzés
Mobil élmény: Ha natív mobilalkalmazást keres, a választás a DeepSeek és a Kimi között van. Mindkettő támogatja a hangbemenetet, az értesítéseket, a munkamenetek szinkronizálását és a képfeltöltést. A DeepSeek alkalmazás letisztultabb és magyar nyelvű elemeket is tartalmaz; a Kimi alkalmazás a Codex integráció miatt kissé zsúfoltabb. A többi modell csak böngészős webchaten érhető el.
API-first stratégia: Mind a hat modell elérhető programozói felületen, ami lehetővé teszi az OpenClaw és OpenWebUI integrációt. Az OpenRouteren egyetlen API-kulccsal, egységes formátumban érhető el az összes modell - a váltás egy paraméter cseréje.
Nyílt súlyú: A Qwen 3.7 Max és Plus kivételével minden modell nyílt súlyú. Ez függetlenséget, auditálhatóságot, finomhangolási lehetőséget és költségkontrollt jelent saját infrastruktúrán.

6. OpenClaw és OpenWebUI - így használjuk mi
A Central PC-nél a kínai modellek két platformon futnak. Az OpenClaw az autonóm ágens keretrendszer: folyamatosan fut, memóriát kezel, ütemezett feladatokat futtat, fájlrendszert kezel, segédágenseket indít. Az OpenWebUI a saját gépen futtatható chat felület, ahol közvetlenül beszélgetünk a modellekkel és tesztelünk új utasításokat.
Hogyan osztjuk el a munkát?
A DeepSeek V4 Pro és a Kimi K2.7 Code a két elsődleges modellünk. Az OpenClaw-ban ők dolgoznak a fő szálon, az OpenWebUI-ban is többnyire velük beszélgetünk. A többiek segédágensként vagy ellenőrző szerepben futnak:
| Szerep | OpenClaw-ban | OpenWebUI-ban |
|---|---|---|
| Elsődleges | Kimi K2.7 Code, DeepSeek V4 Pro | Kimi K2.7, DeepSeek V4 Pro |
| Segédágensek | Qwen 3.7 Plus | - |
| Ellenőrzés, audit | DeepSeek V4 Pro, GLM 5.2 | - |
| Kódolás, refaktorálás | - | Kimi K2.7 Code, Qwen 3.7 Max |
| Multimodális feladatok | Qwen 3.7 Plus | MiniMax M3 |
Mi vált be és mi nem?
DeepSeek V4 Pro és Kimi K2.7 Code: Ők ketten váltak be a legjobban. A DeepSeek stabil, megbízható, kiválóan kezeli a magyar nyelvet, 384 ezer tokenes kimeneti kapacitása hosszú szövegekhez ideális. A Kimi vizuális kódolási képessége egyedülálló, a Kimi Codex parancssori felületen keresztül a terminálból dolgozik. Mindkettő nyílt súlyú.
Qwen 3.7 Plus: Segédágensekre tökéletes - olcsó, gyors, natív kép- és videó bemenet. A tiltásokat ignorálja, ezért korlátozott feladatkörben használjuk.
MiniMax M3: Jelenleg a promóciós ár miatt a legolcsóbb csúcskategóriás modell, versenyképes mérési eredményekkel. Időnként ázsiai írásjeleket szúr a kimenetbe, ezért felügyelet nélküli kritikus feladatokra nem bízzuk.
GLM 5.2: Hosszú távú ágensfeladatokban kiváló, 1 millió token kontextusablakkal. A ellenőrzés nélküli felülírás miatt minden munkamenet végén ellenőrizzük a fájlok állapotát.
Qwen 3.7 Max: A legjobb mérési eredmények, de drága és csak API-n. Csak kivételes feladatokra használjuk.
A munkafolyamatunk
A feladatok ~80%-át a DeepSeek és a Kimi viszi, a maradék 20%-ot a Qwen Plus, vagy GLM (segédágensek). A drága modelleket csak akkor vetjük be, ha a többiek nem boldogulnak.
Ha hasonló átálláson gondolkodik: kezdje kicsiben - válasszon egy modellt elsődlegesnek, hetekig csak azt használja, ismerje meg a gyengéit, és csak utána adjon hozzá további modelleket. És mindig készítsen biztonsági mentést, mielőtt egy modell fájlhoz nyúl.

7. Rangsor - mit ajánlunk saját tapasztalataink alapján?
A Central PC-nél hónapok óta használjuk ezeket a modelleket. Az alábbi rangsor a saját gyakorlati tapasztalatainkat tükrözi - nem pusztán mérési eredményeket.
A legjobb választás OpenClaw elsődleges modellnek. Kiváló magyar nyelvi támogatás, megbízható szabálykövetés, 384 ezer tokenes kimeneti kapacitás, stabil API. Nyílt súlyú (MIT). LiveCodeBench 93.5%.
Kódolásban és multimodális feladatokban verhetetlen. Kimi Codex parancssori felület, vizuális kódolás képernyőképből és Figmából. Nyílt súlyú (Modified MIT).
1 millió token kontextus (5× növekedés az előző generációhoz képest), kétféle gondolkodási mód (lite/max), hosszú távú ágensfeladatokban kiemelkedő. Nyílt súlyú (MIT). Hátránya a gyengébb magyar nyelvű teljesítmény és a lassú válaszidő.
A legolcsóbb csúcskategóriás modell ($0.30/$1.20), 1 millió token kontextus, nyílt súlyú, natív multimodális. Költséghatékonyságban verhetetlen. Napi automatizációra jó, kritikus feladatokra nem.
A legjobb mérési eredmények (SWE-bench Pro 60.6%, GPQA 92.4%), 35 óra autonóm futás. Zárt, csak DashScope API-n. Csak kivételes komplex feladatokra.
Egyszerű, de jó multimodális modell. Natív kép- és videó bemenet, kedvező árú, zárt súlyú. Segédágensekre ideális jól körülhatárolt feladatokban.
8. Összegzés
2026 közepére a kínai modellek olyan szintre értek, nem létezik egyetlenetlen „legjobb” modellről. A feladat határozza meg, melyiket érdemes használni. Ez vezetett minket a multi-modelles stratégiához.
A kínai modellek már nem „olcsó alternatívák”, hanem Terminal-Benchben, SWE-bench Pro-ban és ár-teljesítményben piacvezetők. A nyugati modellek továbbra is erősek az általános érvelésben és az utasításkövetésben (IFEval), de a szakadék gyorsan záródik.
Záró gondolat
A mesterséges intelligencia jövője nem egyetlen modellé, cégé vagy országé. A kínai modellek belépése nemcsak drasztikusan csökkentette az árakat, hanem felgyorsította az innovációt is - a nyílt súlyú modellek, az extrém hosszú kontextusablakok, a terminál-alapú autonóm ágensek és a vizuális kódolás mind részben a kínai cégeknek köszönhető.
2026 második felében a kérdés nem az lesz, hogy a kínai vagy a nyugati modellek a jobbak, hanem hogy mennyire tudjuk kihasználni ezt a példátlanul széles eszköztárat. A multi-modelles stratégia csak egy megközelítés, de az irány egyértelmű: a jövő a személyre szabott AI-eszköztáré, nem az egyetlen, mindenre használt csúcsmodellé.
Hívjon minket: 06 72 738 473

Több mint 30 éve dolgozom a technológiában: tévé- és rádióstúdiókból indultam, rendszereket építettem, javítottam hardverből, szoftverből és hálózatból. Cikkeim az IT-hibák, kreatív gondolkodás és AI-logika határán mozognak.
© 2026 Central PC, Pécs. Minden jog fenntartva.

