Claude Opus 5: rovnaká cena za token, iný tvar odpovede a dátové podmienky, s ktorými sa dá nasadiť
Opus 5 vyšiel 24. júla za rovnakých $5 / $25 ako Opus 4.8, s predvolene zapnutým premýšľaním, piatimi úrovňami úsilia a oknom 1 mil. tokenov. Kontrolný zoznam pre migráciu, tabuľka benchmarkov čítaná podľa toho, kto ktorý riadok spustil, miera zásahov klasifikátora, na ktorej v produkcii záleží, a čo naozaj stojí rezidencia v EÚ.
Tento týždeň vydal Anthropic Claude Opus 5. Prišiel v piatok 24. júla pod ID claude-opus-5, za $5 a $25 za milión tokenov, teda za rovnakú cenu ako Opus 4.8, s kontextovým oknom 1 mil. tokenov a ako nový predvolený model v pláne Max. Oznámenie ho predstavilo slovami, že sa „blíži k frontier inteligencii modelu Claude Fable 5 za polovičnú cenu“. To, čo potrebuje vývojár vedieť ako prvé, je napísané menším písmom: premýšľanie je teraz zapnuté, kým ho nevypnete, a to mení účet aj tvar odpovede.
Pri každom benchmarku nižšie je uvedené, kto ho spustil, lebo pri tomto vydaní nesie táto informácia viac než samotné skóre.
Čo sa pokazí, keď zmeníte reťazec modelu
Cenník sa nepohol. Opus 5 stojí $5 za milión vstupných a $25 za milión výstupných tokenov, „bez zmeny oproti Claude Opus 4.8“, čítanie z cache stojí $0,50 a Batch API je za polovicu. Okno 1 mil. tokenov je „predvolená aj najvyššia hodnota“, výstup končí pri 128 000 tokenov a celé okno sa účtuje štandardnou sadzbou. Fast mode, výskumný náhľad dostupný len na Claude API, beží „až s 2,5-krát vyšším počtom výstupných tokenov za sekundu“ za $10 a $50.
ID modelov Anthropicu sú pevné snapshoty, a to vrátane tých bez dátumu, takže vo vašom systéme sa nič nezmení, kým nezmeníte reťazec. Keď to spravíte, migračná príručka vymenúva, čo čakať. Brali by sme ju ako kontrolný zoznam:
- Premýšľanie beží, aj keď pole vynecháte. Na Opus 4.8 bežala požiadavka bez poľa thinking bez premýšľania. Na Opus 5 beží tá istá požiadavka s adaptívnym premýšľaním. max_tokens „zostáva tvrdým limitom na celý výstup, teda premýšľanie plus text odpovede“, takže rozpočet naladený na 4.8 vám teraz môže odpoveď useknúť.
- Rovnaká cena môže znamenať vyšší účet. Tokeny premýšľania „sa účtujú ako výstupné tokeny, aj keď sa vám text premýšľania nevráti“. Záťaž, ktorá na 4.8 bežala bez premýšľania, vyprodukuje na jednu požiadavku viac výstupných tokenov pri rovnakej sadzbe.
- Parsovanie podľa pozície prestane fungovať. Odpoveď môže začínať jedným alebo viacerými blokmi thinking, ktoré predvolene prídu prázdne. Príručka je priama: kód, ktorý číta content[0].text, alebo spracovanie streamu, ktoré predpokladá, že prvý blok je text, sa na týchto odpovediach pokazí. Bloky vyberajte podľa poľa type.
- Na dvoch najvyšších úrovniach úsilia sa premýšľanie vypnúť nedá. thinking: {"type": "disabled"} s úsilím xhigh alebo max vráti chybu 400. Nižšie je to povolené, no Anthropic upozorňuje, že model potom môže zapísať volanie nástroja do obyčajného textu, a odporúča nechať premýšľanie zapnuté na nižšej úrovni úsilia.
- Slučky s nástrojmi musia bloky premýšľania vracať nedotknuté. Posielajte ich späť „úplné a nezmenené“ spolu s výsledkom nástroja. Upravené, preusporiadané alebo vynechané bloky API odmietne chybou 400.
- Vzorkovacie parametre API odmieta, a toto je zdedené. Iná než predvolená hodnota temperature, top_p alebo top_k vráti na Claude Opus 5 chybu 400, rovnako ako na Claude Opus 4.7. Oproti 4.8 to nie je zmena. Zasiahne tímy, ktoré prichádzajú z Opus 4.6 alebo staršieho, spolu so zrušeným ručným rozpočtom na premýšľanie, zrušeným prefillom a novším tokenizérom.
Potom je tu úsilie. Oznámenie Anthropicu hovorí o „nastavení úsilia modelu“; „dial“ a „toggle“ sú slová novinárov a Fortune vo svojom texte vymenoval tri úrovne. Dokumentácia ich uvádza päť: low, medium, high, xhigh a max, pričom high je predvolená hodnota API. Parameter nie je nový, mali ho už Opus 4.5 až 4.8. Nové je podľa Anthropicu to, že Opus 5 „premieňa dodatočné úsilie na lepšie výsledky spoľahlivejšie než ktorýkoľvek skorší model Opus“. Príručka dodáva, že sa zmenilo množstvo tokenov, ktoré stojí za každou úrovňou, radí spustiť na vlastných evaloch nový prieskum úrovní úsilia a pripúšťa, že max môže prinášať klesajúce výnosy. Ako to vyzerá, ukazuje jej vlastný beh benchmarku.
„Rovnaká cena“ je výrok o cenníku. Keď je premýšľanie predvolene zapnuté, hýbe sa iné číslo: tokeny na požiadavku.
Čítajte tabuľku podľa toho, kto ju spustil
Súhrnná tabuľka v system card mieša v jednej mriežke štyri druhy dôkazov. Rozdelená vyzerá takto, s Opus 5 na najvyššom úsilí, ak nie je uvedené inak.
- Artificial AnalysisGDPval-AA v2, hodnotenie Elo nad 220 odbornými úlohami: Opus 5 1861 na max a 1827 na xhigh, to druhé „o 25 % menej výstupných tokenov“. Fable 5 1747, GPT-5.6 Sol 1736, Opus 4.8 1593. Na AA-Briefcase 1720 oproti 1574 pre Fable 5.
- ARC Prize FoundationARC-AGI-3: overených 30,16 % na úrovni high, oproti 7,78 % pre GPT-5.6 Sol a 1,52 % pre Opus 4.8. Oznámenie hovorí o „trojnásobku“ druhého najlepšieho modelu, system card o „zhruba štvornásobku“; citujte radšej skóre. Na ARC-AGI-2 vedie Sol, 92,5 ku 90,4.
- Harbor, autori benchmarkuFrontierBench v0.1: Opus 5 43,3, GPT-5.6 Sol 34,4, Fable 5 33,8, Opus 4.8 21,1.
- AnthropicSWE-bench Pro 79,2, oproti 80 pre Fable 5, 69,2 pre Opus 4.8 a 64,6 pre Sol. OSWorld 2.0 70,6 oproti 66,1 pre Fable 5. Na DeepSWE v1.1 vedie Sol, 72,7 ku 68,8.
FrontierBench existuje v dvoch sadách čísel a v sekundárnych textoch sa miešajú, preto výslovne: riadok vyššie je beh od Harboru a ten treba použiť pri porovnávaní dodávateľov. Fig. 01 používa vlastný beh Anthropicu na harnesse mini-SWE-agent, ktorý ako jediný uvádza úrovne úsilia; v ňom dosiahol Fable 5 33,7 a Opus 4.8 18,7. Tvrdenie Anthropicu, že Opus 5 výkon Opus 4.8 „viac než zdvojnásobuje“, platí v oboch.
Riadok z tej časti system card, ktorý by sme si vzali na produkčnú revíziu, opisuje klasifikátor: bezpečnostné klasifikátory Opus 5 označili a odmietli 5 % volaní API v 4 % všetkých pokusov a požiadavky prevzal Opus 4.8. Klasifikátory Fable označili 42 % volaní API v 26 % pokusov. Bolo to na benchmarku výpočtovej biológie, fyzikálnych simulácií, CAD, formálnych dôkazov a výkonu na GPU. Inými slovami, na bežnej vede a inžinierstve.
Titulková verzia Anthropicu znie, že kybernetické klasifikátory Opus 5 zasahujú „zhruba o 85 % menej často než pri Fable 5“. Detail z benchmarku hovorí niečo ostrejšie. Trasa, ktorá pre technickú prácu menuje Fable 5, bola podľa týchto čísel často trasou na Opus 4.8 s fakturačným riadkom Fable 5. Opus 5 odpovedá väčšinou sám za seba.
Výhradu ku všetkému napísal Apidog deň po vydaní: v čase písania podľa neho žiadna tretia strana nezverejnila reprodukciu ani jedného z týchto výsledkov. Pre riadky od Anthropicu je to fér. The Decoder, ktorý v ten istý deň čítal dáta Artificial Analysis, uviedol celkový index 61 pre Opus 5, 60 pre Fable 5 a 59 pre GPT-5.6 Sol, čo je remíza s poradím navrchu, a cenu za úlohu na AA-Briefcase $17,79 na max a $10,41 na high.
Kde beží a za akých dátových podmienok
Opus 5 bol v prvý deň na každej platforme: Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud aj Microsoft Foundry. Pre kupujúceho v EÚ sa ten zoznam delí na dve časti.
Vlastné API Anthropicu nemá región v EÚ. Dokumentácia k rezidencii dát to hovorí bez okolkov: pre inference_geo sú dostupné len hodnoty „us“ a „global“ a pre workspace geo je zatiaľ dostupná len hodnota „us“. Inferencia výhradne v USA má násobiteľ 1,1×. Pre Európu nie je čo vybrať.
Rezidencia v EÚ teda znamená hyperscalera a stojí desať percent. Na Bedrocku pokrýva inferenčný profil EU Frankfurt, Zürich, Štokholm, Miláno, Španielsko, Írsko, Londýn a Paríž, pričom Štokholm a Írsko sú dostupné aj ako samostatné regióny, a regionálne endpointy majú oproti globálnym prirážku 10 %. Na Google Cloud má multiregionálny endpoint eu rovnakú prirážku a modely novšie než Sonnet 4.6 sa na jediný región ukotviť nedajú vôbec. Na Microsoft Foundry sú typy nasadenia Global Standard a US Data Zone Standard; žiadna dátová zóna EÚ v zozname nie je. Dva detaily si overte skôr, než niekomu sľúbite región: dokumentácia Bedrocku vymenúva modely otvorené všetkým zákazníkom a Opus 5 medzi nimi nie je, jeho riadok odkazuje na konzolu s prístupmi, a tabuľka regiónov platí pre platformu, nie pre jednotlivý model.
Prirážka nie je jedinou cenou za ukotvenie. Mimo vlastného API Anthropicu prichádzate o fast mode, o serverový fallback a na Bedrocku aj Google Cloud o Batch API s jeho 50 % zľavou. To je obmedzenie smerovania a patrí do policy súboru ku každej trase.
V dátových podmienkach je správa dobrá. Oznámenie hovorí, že Opus 5 „nemá pri všeobecnom prístupe požiadavky na uchovávanie údajov“, kým Fable 5 vyžaduje 30-dňové uchovávanie a zákazníkom s nulovým uchovávaním je bez súhlasu Anthropicu zatvorený. Pri Bedrocku Anthropic uvádza, že služba beží s „nulovým prístupom operátora“; pri nasadeniach Foundry hostovaných na Azure „prompty a odpovede zostávajú v Azure“ a von idú len metadáta o používaní a obsah označený bezpečnostnými systémami. Pre regulovanú záťaž v EÚ, ktorá podmienky Fable prijať nemohla, bol Opus 5 prvým modelom tejto generácie na hornom konci ponuky, ktorý sa zmestí do existujúcej zmluvy o spracúvaní údajov.
Náš pohľad
Opus 5 je vydanie tohto leta, ktoré mení najviac trás, a robí to kombinácia: skóre do jedného bodu od Fable 5 v programátorských riadkoch, na ktorých záleží, polovičná sadzba, žiadna povinnosť uchovávať údaje, klasifikátor, ktorý technickú prácu necháva na pokoji, a endpointy ukotvené v EÚ u dvoch hyperscalerov. Pre väčšinu produkčných systémov v EÚ je to najvyšší model, ktorý naozaj viete nasadiť za podmienok, ktoré už máte.
Priama náhrada to nie je a nikomu by sme nedovolili tak s ním zaobchádzať. Reťazec modelu meňte za evalovou bránou. Porovnávajte cenu za úlohu, nie cenu za token, lebo premýšľanie teraz beží predvolene a predvolené úsilie je high. Model a úsilie skúmajte spolu: low a medium na Opus 5 súperia so Sonnet 5 a xhigh súperí s Fable, takže povýšiť treba najlacnejšiu kombináciu, ktorá prejde vašou vlastnou zlatou sadou. Opus 4.8 si nechajte zapojený ako fallback; označené požiadavky aj tak končia tam a pred májom 2027 nikam neodíde.
Poctivá hranica: takmer každé skóre vyššie pochádza od dodávateľa alebo z rebríčka, ktorý sa hýbe, a nič z toho nebolo namerané na vašich dátach. Model card je dôvod spustiť eval a jeho výsledok nahradiť nevie.
Ak chcete takú evalovú bránu postaviť, alebo routing policy, v ktorej sú úsilie a región plnohodnotné polia, presne to robí Sebrona pre tímy vnútri dátovej hranice EÚ. Napíšte na info@sebrona.com.
Zdroje
Odkiaľ pochádzajú ceny, správanie API a skóre. Pri každom benchmarku je uvedené, kto ho spustil. Citáty sme preložili z angličtiny.
- Oznámenie Claude Opus 5Vydanie, cena, veta o „polovičnej cene“, „nastavenie úsilia modelu“, predvolený model v pláne Max, údaj 85 % pri klasifikátoroch, fallback na Opus 4.8, veta o uchovávaní údajov a tvrdenia o Frontier-Bench, CursorBench a ARC-AGI 3.
- System card Claude Opus 5Tabuľka 8.1.A a časti 8.5, 8.13 a 8.14: každé skóre v § 02, výsledky podľa úrovne úsilia vo Fig. 01, kto ktorý benchmark spustil a miery zásahov klasifikátorov vo Fig. 02.
- Dokumentácia Opus 5: prehľad, čo je nové, migračná príručkaID modelu, limity kontextu a výstupu, ceny za cache a batch, fast mode, pevné snapshoty, predvolene zapnuté premýšľanie, max_tokens, content[0].text, chyba 400 pri vypnutom premýšľaní na xhigh a max, bloky premýšľania v slučkách s nástrojmi, vzorkovacie parametre a rada o prieskume úrovní úsilia.
- Effort, data residency, Bedrock, Google Cloud, Foundry, deprecationsPäť úrovní úsilia; obmedzenia inference_geo a workspace geo; regióny EÚ, 10 % regionálna prirážka a poznámka o prístupe na Bedrocku; multiregionálny endpoint eu; typy nasadenia na Foundry a vyhlásenie o dátach na Azure; najskoršie dátumy vyradenia pre Opus 4.5 až 5.
- Tlač a recenzieFortune o „toggle“ a troch úrovniach (24. 7.); The Decoder o indexe Artificial Analysis a cene za úlohu na AA-Briefcase (25. 7.); Apidog o chýbajúcich reprodukciách (25. 7.).
- NeoverenéPodmienky prístupu k Opus 5 na Bedrocku, ktoré úrovne úsilia ponúkajú spotrebiteľské aplikácie a dostupnosť Opus 5 v každom jednotlivom regióne EÚ. Pred záväzkom si to overte v konzole AWS.