Prečo sa návrh AI agentov mení rýchlejšie, než si väčšina tímov uvedomuje
Tri vlákna z radaru tento týždeň, na ktorých konáme: KV cache reuse ako nákladová páka, ktorú každý znova objavuje; agentské skills nahrádzajú tool call ako jednotku návrhu agenta; a predikcia výkonu sa stáva cvičením, ktoré vieme obhájiť číslami. Štvrté je RL credit assignment, ktoré sledujeme, ale zatiaľ na ňom nekonáme.
Väčšinu týždňov radar vytiahne šum a osem položiek, z ktorých si jeden paper za týždeň občas pýta Slack thread. Tento týždeň ich vytiahol štyri.
Tri z nich zmenili niečo, čo už na našom roadmape je. Štvrté zmenilo to, ako očakávame, že roadmap bude vyzerať o rok. Stojí za to vytiahnuť ich po poradí.
1. KV cache je nákladová páka, ktorú každý znova objavuje
Štyri dni za sebou sa papery a launchy zbiehali na rovnakom závere: ekonomika produkcie stojí na cache.
KVBoost prišiel ako Show HN s tvrdením o 5–48× rýchlejšom time-to-first-token cez chunk-level reuse KV cache v HuggingFace. KVServe sa na radare objavil tri rôzne dni a navrhuje service-aware kompresiu KV cache pre disaggregated LLM serving, kde prefill a decode bežia na rozdielnych strojoch a KV stav musí prejsť po sieti. DeepSeek vydal reasonix, natívneho coding agenta postaveného okolo agresívneho cachovania a per-token štruktúry ceny, ktorá berie cache hit rate ako prvotriedny vstup, nie ako vedľajší efekt. A vlákno na Hacker News, ktoré sa objavilo 25., dospelo k tomu istému zo spodu stacku: pamäť narástla na takmer dve tretiny komponentových nákladov AI čipov.
Nie sú to tie isté papery. Spoločný menovateľ: odbor si na štyroch rôznych vrstvách stacku uvedomuje to isté. Input tokeny opakované naprieč obratmi sú tam, kde reálne leží účet, a cache je najlacnejší nástroj, ako ich orezať.
Nie je to nové. Anthropic nasadil prompt caching v 2024. DeepSeek-V3 paper z konca 2024 organizoval celú inference cestu okolo cache. Nová je granularita. KVBoost je chunkovaný, nie viazaný na prefix, čo znamená, že cache vie zasiahnuť aj text v strede správy: citovanú sekciu dokumentu, výsledok toolu, ktorý sa opakuje naprieč sessionmi, kúsok retrieved kontextu. KVServe ten istý poznatok prenáša po sieti: stlačiť cache na takú veľkosť, že sieť už nie je úzkym hrdlom. Cena pamäte to spečaťuje. Cache reuse už nie je percentuálna optimalizácia; je to rozdiel medzi workloadom, ktorý beží na marži, a workloadom, ktorý beží na nákladoch.
Cache reuse už nie je percentuálna optimalizácia. Je to rozdiel medzi workloadom, ktorý beží na marži, a workloadom, ktorý beží na nákladoch.
Ako to vyzerá vnútri JARVIS-u
Naša JARVIS routing vrstva beží s explicitnými cache_control breakpointmi. Štruktúra je konceptuálne jednoduchá: prompt sa stavia po vrstvách, každá vrstva dostane breakpoint podľa toho, ako často sa mení:
# Pseudocode for clarity — actual construction lives in jarvis/prompt/builder.py
prompt = [
# Layer 1: stable instructions, change weekly at most
{
"role": "system",
"content": [{
"type": "text",
"text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral", "ttl": "1h"}
}]
},
# Layer 2: client context, change per-engagement
{
"role": "user",
"content": [{
"type": "text",
"text": client_context,
"cache_control": {"type": "ephemeral", "ttl": "1h"}
}]
},
# Layer 3: recent conversation, change per-turn
{
"role": "user",
"content": [{
"type": "text",
"text": recent_turns,
"cache_control": {"type": "ephemeral", "ttl": "5m"}
}]
},
# Layer 4: current turn, no breakpoint
{
"role": "user",
"content": current_user_message
}
]
1-hodinový breakpoint sedí na texte, ktorý je stabilný cez celý engagement: na system prompte, na klientovej referenčnej architektúre, na definíciách schém, voči ktorým JARVIS pracuje. 5-minútový breakpoint sedí na konverzačnom chvoste. Aktuálny obrat beží bez breakpointu. Na reprezentatívnej multi-turn produkčnej session táto geometria dáva nameraný 68% cache hit rate na input tokeny.
Šesťdesiatosem percent nie je číslo, na ktoré sme hrdí v zmysle prebitia nejakého benchmarku. Je to číslo, na ktoré sme hrdí v zmysle, že sme ho odmerali, zaznamenali a postavili okolo neho eval brány, ktoré blokujú deploy pri regresii. Samotné číslo porastie tak, ako sa chunk-level techniky z KVBoost dostanú do hosted API a my už nebudeme musieť zarovnávať breakpointy s hranicami prefixov.
Čo mení KVServe
Disagregačný uhol v KVServe je miesto, kde sa to stáva zaujímavým pre náš odklon od single-tenant hosted infraštruktúry. Dnes JARVIS beží proti hosted API: Anthropic, Together, Groq. Ekonomika tejto cesty je ekonomikou cache hit rate oproti billing štruktúre poskytovateľa. Multi-tenant deployment je na roadmape; raz ho bude vyžadovať klient kalibru prevádzkovateľa venue kvôli rezidencii dát. Keď tam JARVIS pohne, otázka prestáva znieť „ako často zasahuje cache“ a začína znieť „kde cache žije a koľko stojí ju presúvať“.
Odpoveď KVServe znie: kompresovať agresívne, urobiť kompresiu service-aware (rôzne downstream úlohy znesú rôznu fidelity) a prijať pásmo kvality namiesto úsilia o lossless prenos. Toto nestaviame. Čítame paper a aktualizujeme architektonický runbook pre to, čo očakávame postaviť zhruba v Q3.
Čo sa zmenilo tento týždeň: KVServe sa posunul z „zaujímavého paperu“ na „nosnú referenciu“ v runbook zázname pre prechod na multi-tenant. Samotný prechod je dnes bližšie k vrcholu fronty, ako bol v pondelok. Dôvodom je vlákno o cene pamäte.
2. Agent skills sa potichu stávajú jednotkou práce
Maestro sa tento týždeň objavil dvakrát: reinforcement learning na orchestráciu hierarchických model-skill ensemblov, kde sa orchestrátor učí, ktorý skill zavolať a na ktorom modeli ho zavolať. SkillOpt: executive stratégia pre self-evolving agent skills, kde skills zbierajú feedback z exekúcie a oproti nemu sa zlepšujú. HINT-SD: cielená hindsight self-distillation pre long-horizon agentov, čo je spôsob, akým sa skills zlepšujú na multi-step problémoch bez toho, aby im utiekli tréningové náklady. From Raw Experience to Skill Consumption: systematická štúdia toho, ako sa model-generated skills opakovane používajú, degradujú a potrebujú prerezávanie. ACC: kompilovanie agentových trajektórií do trénovacích dát pre long-context modely, čo je spôsob, akým skills končia ako kompetencia v base modeli a nie ako lešenie okolo neho. GenEvolve a ClinSeekAgent: doménovo špecifická orchestrácia v generovaní obrázkov a klinickom uvažovaní, čo sú prvé produkčné demonštrácie.
A dva YC launchy: Runtime (coding agenti izolovaní v sandboxe pre tímy) a Superset (IDE pre éru agentov), oba organizované okolo agentov ako vývojového primitíva, nie ako čohosi, čo developer občas zavolá.
Spoločný motív je posun v granularite, ktorý sa ľahko prehliadne, lebo každý jednotlivý paper je malý.
Pred rokom bola jednotkou návrhu agenta prompt: dlhý reťazec inštrukcií, príkladov a zoznamu toolov, ktorý buď zafungoval, alebo nie. Pred pol rokom bola jednotkou tool call. Úlohou agenta bolo vybrať správny tool, zavolať ho so správnymi argumentmi a zareagovať na výsledok. Tooly boli bezstavové funkcie opísané JSON Schémou a objavované cez niečo ako MCP.
Tento týždeň sa literatúra zbieha na skille. Skill je pomenovaný, evaluovateľný, skladateľný a občas učiteľný kúsok schopnosti agenta. Má vlastnú evaluation suite, vlastné verzovanie a dá sa povýšiť alebo stiahnuť na základe evidencie. Orchestrátor smeruje na skill, nie na tool, a samotný skill môže byť malou policy natrénovanou proti cieľu, nie switch-case lookupom.
Maestro je z toho clustera najsilnejší paper, lebo priznáva, že samotný problém orchestrácie je problém učenia. Routing logika sa nepíše v YAML-e. Natrénuje sa na produkčných tracoch a nechá sa objaviť, že tento typ otázky smeruje na tento typ modelu s týmto typom context window. Celá orchestračná vrstva sa stane policy.
Celá orchestračná vrstva sa stane policy.
Ako to vyzerá vnútri JARVIS-u
Dnes je tool registry v JARVIS-e štrukturálne MCP-style. Každá schopnosť je YAML záznam, ktorý deklaruje svoje vstupy, výstupy, evaluation set a handler:
# tools/extract_invoice_lines.yaml
name: extract_invoice_lines
version: 0.3.1
description: |
Extract line items from a Slovak invoice PDF.
Returns structured items with quantity, unit, price, DPH rate.
input_schema:
type: object
properties:
pdf_path: {type: string}
expected_currency: {type: string, default: "EUR"}
required: [pdf_path]
output_schema:
$ref: schemas/invoice_lines.json
handler: jarvis.tools.invoice.extract_lines
eval_set: evals/invoice_lines_sk_v2.jsonl
eval_baseline:
field_accuracy: 0.94
line_recall: 0.91
deprecates: []
Pole eval_set je nosné. Tool, ktorý nedeklaruje eval set, nemôže byť povýšený za staging registry. eval_baseline zamyká podlahu: ak eval ďalšej verzie spadne pod baseline, deploy je zablokovaný. Je to tá istá disciplína, akú aplikujeme na upgrady modelov, len o vrstvu nižšie.
Literatúra tohto týždňa navrhuje, aby sme samotný handler nechali byť naučenou policy na podmnožine z týchto schopností; konkrétne na tých, kde prevažuje rozhodovanie nad výpočtom (ktorý model zavolať, ktorý sub-tool zreťaziť, akú retrieval stratégiu použiť). Toto sme ešte neurobili. Schopnosť to urobiť si vyžaduje tréningovú slučku, ktorú zatiaľ neprevádzkujeme. ADR-015 je na stole, jeho návrh ide budúci týždeň.
Čo očakávame, že sa zmení
Pracovný názov ADR-015 je Skills ako prvotriedne artefakty. Návrh v skratke:
- Skills sa verzujú oddelene od agenta, ktorý ich volá.
- Skills deklarujú svoje trénovacie dáta a tréningovú metódu, nie iba handler.
- Skills nesú confidence score, nie iba eval baseline; orchestrátor môže odmietnuť zavolať skill pod prahom.
- Skills sa povyšujú na základe kombinácie eval skóre, kvality produkčných tracov a ľudského review, rovnako ako povyšujeme upgrade modelu.
Nie je to novinka. Je to zhruba to, čo Anthropic urobil so SKILL.md patternom v Claude Code, na čo OpenAI mieri so svojím novším Assistants API a čo Maestro navrhuje matematicky. Nové pre nás je rovnaký štrukturálny záväzok interne: skills nie sú konfigurácia, sú to nasaditeľné artefakty s vlastnou cestou povýšenia. Práca na ďalší kvartál je operatívna: postaviť tréningovú slučku, postaviť bránu povýšenia, postaviť rollback cestu na moment, keď sa naučený skill zhorší voči svojmu predchodcovi.
3. Predpovedanie výkonu sa stáva uchopiteľným
Dva papery, ktoré sa oplatí čítať spolu.
Forecasting Downstream Performance of LLMs With Proxy Metrics navrhuje malú, lacno počítateľnú sadu signálov, ktoré korelujú s plnou evaluáciou výkonu na konkrétnych downstream úlohách. Pointa je prevádzková. Namiesto behu 240-inštancového evalu proti trom kandidátskym modelom kvôli výberu routing cieľa (čo nás stojí peniaze a hodinu wall time na triedu routing rozhodnutia) spočítame proxy a predikujeme z nej.
LLMs as Noisy Channels prerámcuje scaling laws cez Shannonovu informačnú teóriu. Model je zašumený kanál; trénovanie je proces zladenia kapacity kanála s komplexitou prenášaných dát. Prerámcovanie je zaujímavé, lebo vysvetľuje veci, ktoré štandardná literatúra o scaling laws opisuje ako anomálie: prečo niektoré kvantizácie lámu uvažovanie modelu, iné nie, prečo fine-tuning niekedy degraduje schopnosti v patrónoch, ktoré vyzerajú chaoticky, prečo vzťah medzi počtom parametrov a downstream výkonom nie je na každej úlohe monotónny. V pohľade zašumeného kanála to nie sú anomálie. Sú to predvídateľné dôsledky kapacitnej nezhody.
Dôvod, prečo sú zaujímavé spolu, je, že rozhovor o projekcii nákladov, ktorý Sebrona vedie s každým klientom (koľko bude tento workload stáť v škále, na ktorom modeli), bol dva roky odhad od oka. Teraz je to odhad, ktorý vieme obhájiť číslami.
Teraz je to odhad, ktorý vieme obhájiť číslami.
Čo sme urobili
Routing decision log už pre každé routing rozhodnutie zaznamenáva kandidátske modely, vybraný model, počet input tokenov, počet output tokenov, cache hit rate, latency a downstream evaluation score, ak je k dispozícii. Tento týždeň sme pridali jeden stĺpec: predikciu proxy metriky v momente routingu.
Riadok vyzerá zhruba takto:
- ts
- 2026-05-23T14:22:09Z
- session_id
- jrv_01H4Y…
- task_class
- extraction_sk_invoice
- candidates
- [ opus-4-7, sonnet-4-6, mistral-small-3.2 ]
- selected
- sonnet-4-6
- selection_basis
- cost_quality_frontier
- proxy_metric
- 0.872 nové
- proxy_metric_method
- ppl_calibrated_v1
- input_tokens
- 4,820
- output_tokens
- 612
- cache_hits
- 3,108
- cache_misses
- 1,712
- latency_ms
- 1,840
- downstream_eval_score
- null · doplní sa, keď dobehne nočný eval
Proxy metrika je kalibrované perplexity skóre voči 50-inštanciovej held-out sade pre danú triedu úlohy. Zatiaľ ju nepoužívame ako routing vstup. Zaznamenávame ju popri reálnom výsledku pri každom routing rozhodnutí tak, aby sme v priebehu mesiaca mali kalibračnú krivku, ktorú vieme ukázať klientom. Krivka povie: pre úlohy tohto tvaru predpovedá proxy metrika downstream výkon s presnosťou X percentuálnych bodov v Y % prípadov. V priebehu kvartálu, ak kalibrácia drží, sa predikcia stáva routing vstupom: orchestrátor môže odmietnuť smerovať na model, ktorého predpovedaný výkon padne pod prah, bez toho, aby zaplatil za plný eval na potvrdenie.
Toto je tá časť praxe, ktorá sa najviac podobá inžinierskej funkcii: najskôr meraj, potom predikuj, potom automatizuj. Literatúra je dôvod, prečo je „najskôr meraj“ teraz obhájiteľné nad rámec „pozreli sme sa na to v utorok a vyzeralo dobre“.
Rámec zašumeného kanála má dôležitosť aj pred postavením kalibračnej krivky. Hovorí nám, kde očakávať zlyhanie proxy. Úlohy, ktoré sedia blízko hranice kapacity kanála (vysoko komplexné, dlho-kontextové, viackrokové uvažovanie, ktoré sa pod reprezentáciami modelu zle stláča), ukážu horšiu koreláciu medzi proxy a výsledkom než úlohy, ktoré sú pohodlne vnútri kanála. Pri rutinnej extrakcii očakávame, že kalibračná krivka bude tesná. Pri novátorskom uvažovaní voľná. To samo o sebe je užitočné: hovorí nám, ktoré triedy úloh sa dajú lacno smerovať predikciou a ktoré si pýtajú plný eval.
4. RL credit assignment, pozeráme, nekonáme
Na štvrtom vlákne zatiaľ nekonáme. Hovoríme to nahlas, lebo prax, ktorá predstiera, že koná podľa všetkého, čo si prečíta, sa do pol roka stane nečitateľnou.
DelTA sa objavil tri dni za sebou: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards. From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning sa objavil 22. mája. Unsupervised Process Reward Models 23. a 24. mája. Spolu opisujú tichý metodologický posun v tréningu reasoning modelov: od sparse outcome reward na dlhých reasoning reťazcoch k dense process reward, kde každý krok uvažovania dostane credit podľa svojho podielu na finálnej odpovedi.
DelTA konkrétne diskriminuje, ktoré tokeny v reasoning trace boli zodpovedné za správny výsledok: credit-assignment problém aplikovaný na granularite tokenov, kde overenie konečnej odpovede slúži ako supervisory signál. Curriculum paper rozkladá ťažké reasoning problémy na verifikovateľné subproblémy, kde sa credit dá priradiť lokálne, potom zoraďuje curriculum tak, aby sa model naučil subproblémy skôr, než ich začne skladať. Unsupervised PRM práca odstraňuje požiadavku, že per-step rewardy musia byť ručne anotované, čo je nákladné úzke hrdlo, ktoré PRM od škály dosiaľ držalo.
Dôvod, prečo to má význam, je, že reasoning modely, na ktoré budeme smerovať na konci 2026 a začiatkom 2027, budú trénované týmto spôsobom. Hranica cost-quality sa posunie vo chvíli, keď je reasoning lacnejšie dobre natrénovať. Skills, ktoré dnes na súčasných modeloch fungujú zle, pretože sa reťaz láme v polovici, začnú fungovať: arbitráž faktúr, dlhoformátové review zmlúv, viackrokové inžinierske uvažovanie, ťažšie prípady generovania revíznej správy. Práca orchestrátora sa posunie. Časť toho, čo dnes smerujeme na Opus 4.7, lebo je to jediný model, ktorý udrží reasoning reťazec celý, pôjde na Sonnet-class model, ktorý príde v Q4. Cena spadne o viac než polovicu.
Na tomto nekonáme. Nestaviame vlastné PRM ani nedolaďujeme modely. Aktualizujeme priebežnú dvanásťmesačnú projekciu cost-quality frontier, ktorá sedí v zadnej časti každej klientskej ponuky. Tento týždeň sa tá čiara pohla, a pohli sme ňou my.
Toto je v istom zmysle najdôležitejšie vlákno zo štyroch. Nie preto, že by menilo, čo sme tento týždeň robili, ale preto, že mení, k čomu sa majú zaviazať ponuky na budúci rok. Prax, ktorá neoddeľuje „čo nasadzujeme teraz“ od „čo očakávame nasadiť o dvanásť mesiacov“, je prax, ktorá svojich klientov prekvapuje. Prekvapenia sú nepriateľom dlhej spolupráce.
Prekvapenia sú nepriateľom dlhej spolupráce.
Čo publikujeme a prečo
Poznámky z terénu publikujeme, pretože literatúru čítame tak či tak. Jediná otázka je, či sa z toho čítania niečo aj zverejní.
Editoriálne stojíme na tom: prácou architektonickej praxe je preložiť výskum, vydania a launchy z tohto týždňa do rozhodnutí o nasadení v nasledujúcom mesiaci a povedať to explicitne. Väčšina write-upov sa zastaví na „zaujímavý paper“. Naše sa zastavia na „otvorené ADR“, „aktualizovaný runbook“ alebo „projekcia sa pohla“. Ten posledný krok je to, čo odlišuje prax od newsletteru.
Formát má bežať týždenne. Každý príspevok vytiahne dve až štyri vlákna z JARVIS radaru, zoradí ich podľa prevádzkovej relevantnosti a každé vlákno uzavrie konkrétnym dôsledkom: zmena kódu, draft ADR, revízia projekcie alebo úprimná abstencia. Očakávame, že zhruba jeden príspevok mesačne bude obsahovať vlákno, na ktorom explicitne nekonáme. Editoriálna úprimnosť v tom, čo ignorujeme, je sama o sebe informáciou.
Ak je tu niečo zle (citácia, ktorú sme nedotiahli, výsledok, ktorý sme zle prečítali, tvrdenie, ktoré nevieme obhájiť), napíšte na info@sebrona.sk. Opravíme to verejne, s poznámkou na príspevku.
Čítanie
Položky z JARVIS radaru, z ktorých tento príspevok vychádza, v poradí, ako sa objavujú:
- KVBoostChunk-level reuse KV cache pre HuggingFace, 5–48× rýchlejší TTFT.
- KVServeService-aware kompresia KV cache pre komunikačne efektívne disaggregated LLM serving.
- DeepSeek reasonixNatívny agentic coding framework postavený okolo prompt cachingu a ceny.
- Memory has grown to nearly two-thirds of AI chip component costs
- MaestroReinforcement learning na orchestráciu hierarchických model-skill ensemblov.
- SkillOptExecutive stratégia pre self-evolving agent skills.
- HINT-SDCielená hindsight self-distillation pre long-horizon agentov.
- From Raw Experience to Skill ConsumptionSystematická štúdia opakovaného použitia model-generated agent skills.
- ACCKompilovanie agentových trajektórií pre long-context tréning.
- GenEvolveSelf-evolving agenti generovania obrázkov cez tool-orchestrated destiláciu vizuálneho zážitku.
- ClinSeekAgentAutomatizácia hľadania multimodálnej evidencie pre agentic klinické uvažovanie.
- Runtime (YC P26)Coding agenti izolovaní v sandboxe pre tímy.
- Superset (YC P26)IDE pre éru agentov.
- Forecasting Downstream Performance of LLMs With Proxy Metrics
- LLMs as Noisy ChannelsShannonov pohľad na kapacitu modelu a scaling laws.
- DelTADiscriminative token credit assignment pre reinforcement learning z verifiable rewards.
- From Reasoning Chains to Verifiable SubproblemsCurriculum reinforcement learning pre LLM credit assignment.
- Unsupervised Process Reward Models
- Efficient Agentic Reasoning Through Self-Regulated Simulative Planning
- TerminalWorldBenchmarking agentov na real-world terminal úlohách.
Interné referencie Sebrony
Nedávne záznamy zo ship logu, ktoré ukotvujú tvrdenia vyššie. Plný log na /changelog.
- 25. mája 2026JARVIS · invalidácia prompt-cache pri zmene tool-schémy; hit rate sa udržal na 68% naprieč deploymentom.
- 14. mája 2026JARVIS routing prechádza na v2.
- 02. mája 2026Refactor tool registry.
- 18. apríla 2026Prompt-cache plumbing pomenovaný explicitne.
- 11. apríla 2026Cenová kniha so slovenským DPH režimom.
- 09. mája 2026Referenčná architektúra v1.2 · na /tech. ADR-014 dokumentuje preosatie zodpovedností medzi orchestračnou a integračnou vrstvou, ktoré je za ňou.
- 01. júna 2026ADR-015 · skills ako prvotriedne artefakty. návrh. Publikuje sa na /tech po povýšení.