Skip to main content
ENSK
PraxElektrikProJARVISBlog
← Všetky príspevky

Čo MiniMax M2 znamená pre nasadenie AI v súkromných podnikoch

MiniMax vydal MoE s otvorenými váhami, ktorý na token aktivuje 9,8 mld. parametrov a drží krok s hostovaným frontierom. Tri veci sa tým menia; jednu sledujeme.

TémaPoznámky z terénu
Zverejnené27. 5. 2026
AutorMiroslav Striško
Čítanie10 min

MiniMax 26. mája vydal technickú správu k modelu M2. Otvorené váhy, 229,9 mld. parametrov spolu a 9,8 mld. aktivovaných na token. Skóre v benchmarkoch je v rozsahu jednotiek percentuálnych bodov za hostovanou špičkou, a to na úlohách, ktoré sa dajú opakovane spustiť v produkcii. Rebríček nie je príbeh; ten leží v tom, čo open-weight model na tejto výkonnostnej úrovni urobí s každou tabuľkou pre nákup AI v nasledujúcich dvanástich mesiacoch.

Tri veci sa menia tento týždeň. Štvrtá (tá, ktorú zatiaľ sledujeme a nekonáme) mení to, ako bude tá tabuľka vyzerať v roku 2027.


1. Čísla, zoradené podľa toho, čo vám reálne kúpia

Checkpoint M2.7 proti benchmarkom, ktoré sa premietajú do opakovateľných produkčných úloh:

SWE-bench Pro
56,2 softvérové inžinierstvo na úrovni repozitára · GPT 5.4 reportuje 57,7
SWE-bench Multilingual
76,5 úpravy kódu naprieč jazykmi
AIME 2026
94,2 súťažná matematika
GPQA-Diamond
89,8 prírodovedné otázky na úrovni doktorandov
GDPval-AA
50,0 kancelárske úlohy proti výstupom expertov

Toto nie sú hračkárske benchmarky. SWE-bench Pro na úrovni 56 je prah, nad ktorým model produkuje malé až stredne veľké pull requesty, záplaty, ktoré senior recenzent zmerguje s drobnými úpravami namiesto toho, aby ich napísal odznova. GDPval-AA na 50 znamená, že model je konkurencieschopný voči človeku-profesionálovi na merateľnom podiele bežných kancelárskych výstupov: analytické prezentácie, briefing memá, vystavané spreadsheety.

Hostované frontier API stále vedú v najťažších kategóriách. Rozdiel je dva až štyri percentuálne body. Pre nákup nie je relevantná otázka, na ktorej strane rozdielu daná pracovná záťaž leží. Otázka je, koľko každý percentuálny bod stojí, keď sa vynásobí ročným objemom tokenov.


2. Prečo MoE s 10 mld. aktivovaných parametrov prepisuje tabuľku

Hustý (dense) model s veľkosťou M2 by aktivoval 229,9 mld. parametrov na každý token. M2 aktivuje 9,8 mld. Rovnaký celkový počet parametrov je modelu k dispozícii, výpočtovo na požiadavku ale výrazne menej. Mechanizmom je architektúra Mixture-of-Experts: sieť drží 256 expertných podsietí a routing vrstvu, ktorá na každý token vyberie 8 z nich. Zvyšných 248 zostane pre ten token „studených“. Analógia z nemocnice: 256 špecialistov v stave, 8 z nich pri každom pacientovi. Inštitúcia pokrýva rovnaký záber prípadov ako oveľa väčšia, za zlomok prevádzkových nákladov.

Tri konkrétne dôsledky pre produkciu.

Cena za token škáluje s aktívnymi parametrami, nie s celkovými. Pracovná záťaž, ktorá ide na päťcifernom mesačnom účte za tokeny cez hostované frontier API, klesne na inferencii rádovo, keď to isté beží na modeli triedy M2 na vlastnom hardvéri. Hák je v amortizácii GPU: pod úrovňou pracovnej záťaže (zhruba nižšie päťciferné mesačné sumy za hostovanie, podľa profilu) self-hosting nie je lacnejší, len suverénnejší.

Latencia na token klesá s aktívnymi parametrami. Interaktívne plochy (interné chat-copiloty, hlasoví agenti, dopĺňanie kódu) platia cenu latencie pozornosťou používateľa, nielen v eurách. Model, ktorý vydáva tokeny dvakrát rýchlejšie pri rovnakej kvalite, zhadzuje zo stola nákupnú námietku, akú žiadne zníženie ceny API nezvládne.

Suverenita nasadenia mení tvar. M2 sa dodáva s otvorenými váhami pod licenciou modified-MIT, ktorá umožňuje komerčné on-prem nasadenie pod hranicou 100 mil. mesačných aktívnych používateľov / 30 mil. USD ARR (nad ňou sa vyžaduje uvedenie atribúcie). Nie je to Apache-2.0, takže si pred nasadením prečítajte samotnú licenciu. Pracovné záťaže, ktoré pri nákupe zastavovali požiadavky na lokalitu dát alebo regulácia odvetvia (financie, zdravotníctvo, verejná správa, GDPR-citlivý koniec spotrebiteľských produktov), získavajú frontier-tier voľbu, ktorá beží vo vnútri zákazníckeho perimetra namiesto volania na americké API.

Čo sa tento týždeň zmenilo, nie je nič z týchto výhod osebe. Posunul sa strop open-weight modelov o ďalší viditeľný krok smerom k stropu hostovanému. Rozdiel je teraz dosť malý na to, aby pre pracovné záťaže, na ktoré sa zúžil, vyhralo „cena plus suverenita plus stačí“ nad „o trochu lepšie plus hostované plus americké“.

„Cena plus suverenita plus stačí“ teraz vyhráva nákupnú diskusiu nad „o trochu lepšie plus hostované plus americké“.


3. Tréningovým cieľom sú agenti, nie inferencia

Najzaujímavejšia časť správy o M2 nie je architektúra. Je to metodológia tréningu.

MiniMax opisuje dva systémy stojace za checkpointom M2.7.

Prvým je agentský dátový pipeline. Namiesto škálovania na ďalšom surovom texte MiniMax postavil infraštruktúru, ktorá generuje tréningové trajektórie ukotvené v reálnych spustiteľných prostrediach: GitHub repozitáre s prechádzajúcimi test suite, dockerizované nástrojové prostredia, terminálové sedenia, manipulácie so spreadsheetmi, interakcie v prehliadači. Každá trajektória nesie overiteľnú odmenu: prešla záplata testami, dali spreadsheet očakávané hodnoty, vrátila nasadená aplikácia status 200.

Druhým je Forge, systém na učenie posilňovaním (reinforcement learning) postavený pre agentov. Forge oddeľuje white-box agentov (ich vnútro vie tréner skúmať) od black-box agentov (zaobchádzaných ako nepriehľadní producenti trajektórií). Toto oddelenie je to, vďaka čomu jeden základný model vie trénovať proti stovkám rozličných agentských scaffoldov bez toho, aby sa pre každý dotrénovával zvlášť.

Operatívny záver je ten, ktorý klientom hovoríme už viac ako rok. Teraz prichádza ako tréningové potvrdenie veľkého laboratória.

Základný model sa stáva lacnou časťou nasadenia AI. Drahé časti sú agentský scaffold, integrácia nástrojov, evaluačný systém a doménové dáta, ktoré z „model vie o faktúrach vo všeobecnosti“ robia „model zvláda náš pipeline na spracovanie faktúr v presnosti, akú prijme náš audítor.“ Tá vrstva sa skladá proti laboratóriu. Vrstva základného modelu sa komoditizuje.

Keď klientovi hovoríme, nech minie tri mesiace na evaluačný systém predtým, ako minie týždeň na výber modelu, tak práve M2 paper je tá citácia, akú mu ukážeme.


4. Self-evolution, sledujeme, nekonáme

Najprovokatívnejším tvrdením v správe je to, čo MiniMax nazýva self-evolution. M2.7 checkpoint vraj triedil neúspešné tréningové behy vo vlastnej infraštruktúre, sám si upravoval agentský scaffold a (cez 100 kôl autonómnej iterácie bez ľudského kódu v harnesse) zlepšil interný programovací scaffold o 30 % na internej metrike laboratória.

Čítame to s kalibrovanou skepsou. „Self-evolution“ je výraz, ktorý historicky pomenováva systémy s podstatne viac ľudského vedenia, než framingom pripúšťa. Interná metrika nie je štandardizovaný benchmark. Tých 100 kôl nie je opísaných dostatočne podrobne na to, aby sa dalo povedať, čo presne sa za kolo počíta. A krivka zlepšenia, akú laboratórium zverejní, je takmer z definície tá najlepšia, ktorú pozorovalo.

Smer však sporný nie je. Modely, ktoré si zlepšujú vlastnú tréningovú infraštruktúru, už nie sú hypotetické. Strop schopností na agentskom scaffolde (tá vrstva, ktorá podľa nás skladá proti laboratóriu) si vezme laboratórium tiež, len na pomalších hodinách.

Runbook na to zatiaľ nemeníme; aktualizujeme rolujúcu 24-mesačnú projekciu, ktorá stojí za každým viacročným klientskym angažmánom. Časť toho, čo teraz považujeme za „scaffoldovú prácu, ktorú klient vlastní a má z nej úžitok“, urobí do roku 2027 základný model dostatočne dobre na to, aby vlastníctvo neprinášalo výhodu. Práca na najbližší rok je predpovedať, ktoré časti to budú.

Toto je vlákno, na ktorom najviac záleží v nasledujúcom roku, hoci tento týždeň nemení nič.

Scaffold si vezme laboratórium tiež, len na pomalších hodinách.


Čo si od tohto týždňa nesieme do klientskych rozhovorov

Tri posuny na úrovni nákupu, ktoré z vydania M2 vyplývajú. Každý z nich plánujeme do dvoch kvartálov vedieť obhájiť číslami, nie ho bez čísel opakovať.

Prémia za hostované frontier API je dnes číslo, ktoré by nákup mal vedieť obhájiť písomne. Pred rokom bola „proste použite Opus“ bezpečná predvoľba pre akúkoľvek serióznu pracovnú záťaž. Dnes, na strope open-weight modelov definovanom práve M2, sa kvalitatívny rozdiel dá pre reálnu triedu úloh vstrebať kvalitou scaffoldu. Ak pracovná záťaž stojí podstatne viac, ako koľko by stála prevádzka modelu triedy M2 na vlastnom hardvéri, open-weight možnosť si zaslúži riadok v porovnaní, nie poznámku pod čiarou.

Agentská automatizácia prešla z polohy „dá sa to ukázať“ do polohy „dá sa to nasadiť“ na reálnej triede biznis úloh. Benchmarky, na ktorých je M2 konkurencieschopný (viackrokové písanie kódu, hlboký webový výskum, generovanie kancelárskych výstupov naprieč dokumentmi a spreadsheetmi), sa značne prekrývajú s prácou, ktorú slovenský a stredoeurópsky mid-market stále smeruje do interných tímov. Rozdiel medzi „toto sme videli fungovať vo výskumnom labe“ a „toto prevádzkujeme v produkcii pre platiaceho klienta“ sa zužuje rýchlejšie, než akým tempom väčšina trojročných nákupných cyklov ráta.

Základný model je tá lacná časť. Scaffold sa skladá. Hovoríme to od založenia praxe; tréningová metodológia M2 je to potvrdenie. Kam by kupujúci mali v nasledujúcich dvanástich mesiacoch dávať rozpočet, je integračná vrstva (register nástrojov, evaluačný systém, retrieval, doménové dáta) namiesto riadku za základný model. Základné modely sa komoditizujú na verejných hodinách. Integračné vrstvy sa skladajú na súkromných.

Ak je niečo v tomto texte zle (číslo, ktoré sme zle pochopili, výsledok, ktorý sme zle prečítali, tvrdenie, ktoré nevieme obhájiť), napíšte na info@sebrona.sk. Opravy publikujeme verejne s poznámkou pri poste.


Čítanie

Položky, z ktorých tento post čerpá, v poradí výskytu:

  • Technická správa MiniMax-M2Checkpoint M2.7 · 229,9 mld. spolu · 9,8 mld. aktivovaných na token · routing 8 z 256 expertov.MiniMax · 26. máj 2026
  • ForgeRL systém pre white-box aj black-box tréningové vetvy agentov.MiniMax · 26. máj 2026
  • SWE-bench ProHodnotenie softvérového inžinierstva na úrovni repozitára.Princeton · priebežne
  • SWE-bench MultilingualÚlohy softvérového inžinierstva naprieč jazykmi.Princeton · 2025
  • AIME 2026American Invitational Mathematics Examination · súťažná stopa.MAA · 2026
  • GPQA-DiamondPrírodovedné otázky na úrovni doktorandov · diamond split.Rein et al. · 2024
  • GDPval-AAHodnotenie kancelárskych úloh proti výstupom expertov.OpenAI · 2026

Interné referencie Sebrony

Čo v našom stacku sa pohne na pleciach tohto vydania. Celý záznam nasadení je na /changelog.

  • 28. máj 2026Router JARVIS získava MiniMax-M2 ako kandidátsky model pre triedy úloh zarovnané so SWE-bench a pre kancelárske výstupy. Eval brána proti produkčnej cost-quality hranici.cieľ · routing
  • Q3 2026Self-hosted M2 sa vyhodnotí pre klientov s on-prem požiadavkami na lokalitu dát. ADR-016 je na stole.cieľ · architektúra
  • 25. máj 2026Invalidácia cache v registri nástrojov JARVIS; hit rate sa cez deploy udržal na 68 %.naposledy nasadené
  • 14. máj 2026Routing vrstva JARVIS prešla na v2.naposledy nasadené
  • 09. máj 2026Referenčná architektúra v1.2, na /tech. ADR-014 dokumentuje rez medzi orchestračnou a integračnou vrstvou za ňou.nasadené