Skip to main content
ENSK
PraxElektrikProJARVISBlog
← Všetky príspevky

Ako stavať bezpečných AI agentov bez posielania dát do cloudu

Na Computexe dodala NVIDIA dôveryhodnú odpoveď na každej vrstve behu autonómnych agentov na hardvéri, ktorý ovládate: kremík, zapuzdrenie OS, runtime OpenShell, model s otvorenými váhami a agentské frameworky. Titulkom je RTX Spark. To, čo mení nákup, je, že riadenie agentov sa práve stalo bezplatnou, štandardizovanou komoditou, čo posúva trvácnu prácu vyššie, do politiky, workflow a auditu na úrovni GDPR.

TémaPoznámky z terénu
Zverejnené1. 6. 2026
AutorMiroslav Striško
Čítanie13 min

Jensen Huang 1. júna 2026 na NVIDIA GTC Taipei popri Computexe oznámil vstup NVIDIA do PC kremíka, a pod spotrebiteľským titulkom aj to, čo reálne mení, ako firma dostane agentov do produkcie: kompletný softvérový stack na prevádzku autonómnych agentov na hardvéri, ktorý máte pod kontrolou, bez toho, aby sa agent stal rizikom. Čip zožal potlesk. To, čo sme si prečítali dvakrát, je stack pod ním.

Schopnosti nikdy neboli prekážkou. Agenti vedia od začiatku tohto roka čítať a zapisovať súbory, spúšťať shell príkazy, prehliadať web, vytvárať podagentov a bežať bez dozoru celé hodiny. Prekážkou bola plocha vynútenia, ktorú tieto schopnosti vytvárajú. Agent dosť mocný na to, aby bol užitočný, je dosť mocný aj na to, aby vyniesol prihlasovací údaj, exfiltroval nesprávne dáta, riadil sa otrávenou webovou stránkou alebo potichu navŕšil neobmedzený účet za inferenciu. Pod GDPR tento rizikový profil držal agentov mimo produkcie. Úprimnou odpoveďou počas väčšiny roka 2026 bolo počkať.

Nechýbal múdrejší model. Chýbala vrstva medzi agentom a strojom, ktorú agent neobíde rečou, uvažovaním ani jailbreakom, kde sú pravidlá nastavené a vynútené mimo dosahu agenta. To je to, čo 1. júna prišlo. Toto je ten stack, prejdený od kremíka nahor.


To, čo prišlo, je stack, nie čip

Čistý spôsob, ako oznámenie čítať, je ako päť vrstiev, kde každá rieši inú časť úlohy „nech agent robí na mojich systémoch reálnu prácu bezpečne“. NVIDIA dodala dôveryhodnú odpoveď na každej vrstve naraz. A tá súčasnosť je tá správa, nie ktorákoľvek jednotlivá časť.

Kremík robí lokálnu inferenciu reálnou naprieč cenovým rebríkom. RTX Spark (prvý PC čip od NVIDIA, postavený s MediaTekom) nesie až 128 GB zdieľanej pamäte medzi CPU a GPU, dosť, pri zhruba 4-bitovej kvantizácii, ktorú tie čísla predpokladajú, na beh modelov až do 200 mld. parametrov na jednej skrini (405 mld. cez dve jednotky). Na vrchole beží DGX Station for Windows špičkové modely až do 1 bil. parametrov lokálne. Berte tie hlavné čísla ako stropy. Reálny výkon závisí od kvantizácie a dĺžky kontextu. Aj tak je „agent beží na skrini vo vašej kancelárii“ teraz hardvérový fakt, nie slogan.

Vrstvy OS a runtime sú ten ťah, na ktorom záleží, a berieme ich ako jednu myšlienku: obmedzenia vynucuje prostredie, v ktorom agent beží, nie agentov vlastný systémový prompt. NVIDIA a Microsoft spoločne vyvinuli primitíva Windows pre identitu, zapuzdrenie a politiku; OpenShell je cross-platform runtime bohatý na politiky, postavený na rovnakom princípe. Všetko ostatné, model (§03), frameworky, knižnice CUDA-X teraz volateľné ako agentské skills, sa zapája do toho. Zaujímavá časť nie je čip. Je to, že bezpečné, riadené, lokálne spúšťanie agentov má teraz vznikajúci otvorený štandard.


OpenShell: vrstva vynútenia, podrobne

OpenShell je ťažisko a časť, ktorú sa oplatí pochopiť presne. Je to runtime pod licenciou Apache-2.0 na spúšťanie autonómnych agentov v sandboxoch, prvýkrát vydaný 16. marca 2026, ~89 % v Ruste s vrstvou v Pythone. Skôr než na ňom čokoľvek naplánujete, prečítajte si ďalšiu vetu: stále je v alfe. Projekt sa sám opisuje ako „proof-of-life“, jednovývojársky, jednoprostredný, na vetve v0.0.x. Signálom je tu architektúra, nie pripravenosť.

Jadrovým rozhodnutím je, že politika žije mimo procesu agenta a je vynucovaná pod ním. Agent rozhoduje, čo chce robiť; runtime rozhoduje, čo smie robiť; sú to dve vrstvy a agent nikdy nedrží tú druhú, takže ju nevie prepísať. Na Linuxe to ide až do kernelu cez Landlock LSM, každý agent vo vlastnom sandboxe. Vlastný myšlienkový model projektu je „karty prehliadača pre AI agentov“. Celé to beží ako K3s klaster vnútri jediného Docker kontajnera, čo je to, čo umožňuje rovnakým primitívam škálovať z notebooku na multi-uzlový GPU klaster. Lokálny prípad a prípad dátového centra sú ten istý systém v rôznych veľkostiach.

Obrana do hĺbky beží naprieč štyrmi doménami politiky, každá s inou životnosťou vynútenia:

Súborový systém
čítania a zápisy len v povolených cestách zapečatené pri vzniku sandboxu · za behu sa nedajú uvoľniť
Procesy
blokuje eskaláciu privilégií a nebezpečné syscally zapečatené pri vzniku sandboxu
Sieť
blokuje neautorizované odchádzajúce spojenia hot-reloadable za behu
Inferencia
preroutuje volania model API na riadené backendy hot-reloadable za behu

Egress je miesto, kde si dizajn zaslúži svoju cenu. Každé odchádzajúce spojenie je zachytené a vyriešené presne do jedného z troch výsledkov. A vynútenie je na vrstve 7, na HTTP metóde a ceste, nielen na hostiteľovi.

Dva detaily uzatvárajú slučku okolo prihlasovacích údajov. Preroutovanie na inferenciu znamená, že runtime sám zmaže údaje volajúceho a vloží správne backendové údaje. Agent vykoná volanie bez toho, aby kedy držal kľúč. A API kľúče, tokeny a servisné účty sa spravujú ako providers: pomenované balíky vložené pri vzniku sandboxu ako premenné prostredia za behu, nikdy zapísané do súborového systému sandboxu. Agent vie použiť údaj, ktorý nikdy nevie prečítať. A to je rozdiel medzi kompromitovaným agentom, ktorý je zadržaný, a tým, ktorý vám odkráča s tajomstvami.


Modelová vrstva rozhoduje, či je toto všetko reálne

Hardvér a runtime sú bez modelu, ktorý je dosť dobrý na lokálny beh, nečinné, a, čo je kľúčové, bez modelu, ktorého váhy si naozaj smiete stiahnuť a self-hostovať. Zatvorené špičkové modely (Opus, GPT, Gemini) sa self-hostovať nedajú; sú to volanie API do niečieho cudzieho cloudu. Téza lokálneho agenta teda stojí a padá na tom, či pole otvorených váh dobehne zatvorenú špičku na úlohách, na ktorých záleží, hlavne na kódovaní a agentských úlohách.

Vlastnou odpoveďou NVIDIA je Nemotron 3 Ultra, model typu mixture-of-experts s 550 mld. parametrov postavený pre dlhobežiacich agentov, nie pre chat, s nárokom na uvažovanie na úrovni špičky pri až rýchlejšej inferencii a ~30 % nižších prevádzkových nákladoch než porovnateľné špičkové modely. Pri agentoch, ktorí bežia hodiny a robia oveľa viac volaní než chatbot, náklady na token a latencia rýchlo narastajú, takže tá ekonomická veta, ak platí, je celý argument. Keďže OpenShell je model-agnostický, Nemotron je možnosť, nie požiadavka; Claude Code, Codex, OpenCode aj Copilot CLI bežia vnútri rovnakého runtime bez úprav.

Ten istý týždeň pointu vyostril. MiniMax so sídlom v Šanghaji vydal 1. júna M3, pozicovaný ako prvý model s otvorenými váhami, ktorý v jednom systéme spája kódovanie na úrovni špičky, kontextové okno s jedným miliónom tokenov a natívnu multimodalitu.

SWE-Bench Pro
59,0 uvádza dodávateľ · vraj prekonáva GPT-5.5 a Gemini 3.1 Pro, blíži sa ku Claude Opus 4.7
Kontext
1 mil. tokenov spláca to MiniMax Sparse Attention, ~1⁄20 výpočtu na token pri plnom kontexte oproti M2
Cena
0,30 $ / 1,20 $ na mil. tokenov promo na OpenRouteri · ~rádovo nižšie než zatvorené špičkové modely na kód

Tri tvrdé výhrady, lebo práve o ne ide, a tú istú disciplínu uplatňujeme pri každom spustení dodávateľa:

  1. Sú to čísla dodávateľa. Pochádzajú od firmy, ktorá model predáva. Nezávislé benchmarky prídu v dňoch po spustení a porovnania dodávateľa sa pod testovaním tretích strán bežne zmäkčujú.
  2. Váhy ešte nie sú vonku. MiniMax sľúbil otvorené váhy a plnú technickú správu do ~10 dní; počet parametrov ani aktívnych parametrov pri spustení nezverejnil. Kým neprídu, „self-hostovateľné“ je sľub, nie fakt, z ktorého môžete vychádzať.
  3. Benchmark nie je workflow. Model, ktorý dobre skóruje na SWE-Bench Pro, sa môže správať inak na neusporiadanej zmene cez viac súborov v reálnom internom repozitári. Jediný test, ktorý sa ráta, je, či udrží požiadavku, prezrie správne súbory, vykoná zmenu, overí ju a zastaví, na vašom kóde.

M3 je tu ako dôkaz, nie odporúčanie: modelová vrstva sa dopĺňa. Či je práve M3 ten správny model, je otázka, na ktorú odpoviete testom na reálnej úlohe cez API a návratom k nej, keď prídu váhy a nezávislé benchmarky. Štrukturálna pointa platí bez ohľadu na to, ktorý otvorený model vyhrá. Schopné, self-hostovateľné modely prichádzajú a sú tým, čo mení stack z architektonického diagramu na niečo, čo firma vie nasadiť.


Čo sa mení pre európskeho kupujúceho

Tri posuny z toho vyplývajú a prvý je ten, ktorý dostane agentov v Európe cez nákupnú bránu.

Lokálna inferencia sa stáva plnohodnotným cieľom nasadenia. S RTX Spark na spodnom konci a biliónovou skriňou pri stole na hornom konci je „spustiť agenta na hardvéri, ktorý fyzicky ovládate“ reálnou možnosťou naprieč cenovým rebríkom a modelová strana sa zbieha v tom istom čase. V kombinácii s Privacy Routerom OpenShellu (ktorý drží citlivý kontext na lokálnom výpočte a redaguje osobné údaje skôr, než čokoľvek dorazí k cloudovému modelu) je toto zatiaľ najobhájiteľnejšia architektúra pre obavy o lokalitu dát a GDPR. Architektúra, nie záruka compliance: celý zisk stojí na presnosti redakcie, ktorú si overíte na vlastných dátach skôr, než na nej postavíte DPA. Redaktor, ktorý vynechá čo i len jedno pole s osobnými údajmi, znamená porušenie, nie zanedbateľnú chybu. Berte to tak, ako berieme benchmarkové čísla MiniMaxu, sľubné a treba ich dokázať na vašom workloade skôr, než pôjdu do zmluvy.

Ťažká časť nasadenia agenta sa posúva vyššie v stacku. Rok bola otázka „vieme agenta vôbec spustiť bezpečne?“. Tá má teraz zbiehajúcu sa odpoveď, takže ťažkosť sa presúva na rozhodnutia, ktoré za vás runtime neurobí: ktoré workflow sa oplatí odovzdať agentovi, čoho sa každý agent smie dotknúť, čo „povolené“ znamená vo vašom compliance kontexte, kto kontroluje auditný záznam a ako meriate, či agent robí svoju prácu. Nič z toho nerieši sandbox.

Riadenie agentov sa stáva komoditnou vrstvou. Sandboxovanie, vynucovanie politík, izolácia údajov, auditné logovanie (tá nenápadná infraštruktúra) je teraz open-source a zadarmo, s koalíciou dodávateľov, ktorí ju štandardizujú: Cisco, CrowdStrike, Microsoft Security, Google Cloud na strane politík; Canonical a Red Hat na strane OS a infraštruktúry. Keď sa toľko vážnych strán zhodne na jednom runtime, „ako riadiť autonómneho agenta“ začína mať predvolenú odpoveď. Hodnota vety „nainštalujem a izolujem vám agenta“ sa rúti k nule.

Sandboxovať agenta je čoraz lacnejšie. Rozhodnúť, čoho sa smie dotknúť, a dokázať, že sa nedostal ďalej, je práca, ktorá sa nestáva komoditou.


Náš pohľad

Tento stack dnes nie je pripravený na produkciu a tvrdiť opak by bolo predávanie hype-u. OpenShell je v alfe, proof-of-life, jednovývojársky, s očakávanými prelomovými zmenami; multi-tenantná podniková cesta (Kubernetes / Helm) sa výslovne ešte stavia a GPU passthrough je experimentálny. Diely prichádzajú v rozloženom čase: NemoClaw je dostupný teraz, OpenShell je early preview, Nemotron 3 Ultra sa očakáva 4. júna, skrine RTX Spark prídu na jeseň. Natívna skúsenosť na Windowse je opísaná ako prichádzajúca, nie dodávaná.

Postoj je teda presný: berte to ako jasný, dobre financovaný signál, kam smeruje produkčné nasadenie agentov, a ako stack, proti ktorému sa oplatí prototypovať už teraz (na interných, nízkorizikových workloadoch), aby ste o pol roka neštartovali zo studeného. Nie je to stack, na ktorý tento kvartál prestaviate klientske produkčné systémy. Signál pripravenosti, ktorý sledujeme, je cesta OpenShellu z jednohráčskej alfy do multi-tenantného podniku; sledujeme túto čiaru, nie spustenie čipu.

Čo sa nemení, je miesto, kde sedí trvácna práca. Tá nenápadná infraštruktúra sa zbieha do bezplatnej, otvorenej, štandardizovanej vrstvy, čo je presne tá vrstva, ktorú Sebrona nikdy nepredávala. Naša práca je tá časť, ktorú sandbox nerobí: rozhodnúť, ktoré procesy delegovať, napísať politiku pre reálne regulačné obmedzenia, vziať si na starosť audit a change management okolo nej a vybrať model a agenta, ktorí obstoja na vašom kóde, nie na slajde s benchmarkom. Tá práca je tá istá bez ohľadu na to, ktorý runtime alebo model vyhrá, a toto oznámenie ju robí cennejšou, nie menej. EÚ-suverénny postoj s podlahou Apache-2.0, ktorý presadzujeme od založenia praxe, práve dostal referenčnú implementáciu.

Ak už máte agentov v produkcii a chcete ich spoľahlivejších, lacnejších a obhájiteľnejších pod GDPR (alebo sa rozhodujete, ktoré workflow sa oplatí odovzdať jednému z nich), je to práca, ktorú robíme. Napíšte na info@sebrona.com.

Opravy vítame. Ak je niektoré číslo, výsledok alebo tvrdenie nesprávne, napíšte na info@sebrona.com. Opravy zverejňujeme s poznámkou pri poste. Najmä čísla MiniMax M3 uvádza dodávateľ a váhy v čase písania neboli vydané.


Čítanie

Odkiaľ čísla v tomto poste pochádzajú. Všetky odrážajú správy z dňa spustenia a tvrdenia dodávateľov; pred konaním overte proti primárnej dokumentácii.

  • NVIDIA GTC Taipei · Computex 2026RTX Spark, DGX Station for Windows, NVIDIA Agent Toolkit, NemoClaw, Nemotron a bezpečnostné a zapuzdrovacie primitíva Windows.NVIDIA · 1. jún 2026
  • OpenShellAgentský runtime pod Apache-2.0 · politika mimo procesu, Landlock LSM, K3s-v-Dockeri, egress na vrstve 7, providers, Privacy Router. Alfa, v0.0.x.NVIDIA / GitHub · od 16. mar 2026
  • Nemotron 3 Ultra550 mld. MoE otvorený model pre dlhobežiacich agentov · až rýchlejší, ~30 % lacnejší na prevádzku (dodávateľ).NVIDIA · očakávaný 4. jún 2026
  • Hermes AgentNajpoužívanejší agent podľa využitia na OpenRouteri · uzavretá slučka sebazlepšovania, perzistentná pamäť, MIT.Nous Research · od feb 2026
  • MiniMax M3Otvorené váhy, kódovanie + 1 mil. kontext + multimodalita · 59,0 SWE-Bench Pro. Uvádza dodávateľ; váhy čakajú.MiniMax · 1. jún 2026
  • Hardvérové pokrytieŠpecifikácie RTX Spark a rozsah SKU.Tom's Hardware · HotHardware · GSMArena · 1. jún 2026

Interné referencie Sebrony

Čo v našom stacku sa pohne na pleciach tohto oznámenia. Celý záznam nasadení je na /changelog.

  • Q3 2026OpenShell sa vyhodnotí ako sandbox + policy vrstva pre on-prem klientske nasadenia s požiadavkami na lokalitu dát. Sledujeme ho z jednohráčskej alfy do multi-tenantu pred akýmkoľvek vystavením klienta. ADR-017 je na stole.cieľ · architektúra
  • Q3 2026Vzor Privacy Router (lokálny routing kontextu s PII, len sanitizovaný egress) zapracovaný do GDPR postoja referenčnej architektúry.cieľ · architektúra
  • 04. jún 2026Router JARVIS pridáva Nemotron 3 Ultra ako kandidátsky model pre agentské a kódovacie triedy úloh, za bránou našej nočnej eval linky a vydania otvorených váh.cieľ · routing
  • 09. máj 2026Referenčná architektúra v1.2, na /tech. ADR-014 dokumentuje rez medzi orchestračnou a integračnou vrstvou za ňou.nasadené