Claude Opus 5: Špička se právě stala dostupnou
Nový vlajkový model Anthropicu zdvojnásobuje výkon na špičkové úrovni a zároveň snižuje náklady — co to znamená pro každého, kdo staví agentní produkty.
Anthropic dnes vydal Claude Opus 5 a stojí za to se u toho zastavit — ne proto, že jde o dosud nejchytřejší vydaný model (podle několika benchmarků ano), ale kvůli tomu, kolik stojí ho používat.
Opus 5 zdvojnásobuje skóre Opusu 4.8 na Frontier-Bench a přitom je levnější na provoz. Na kódovacích benchmarcích (CursorBench 3.2) se dostává na 0,5 % skóre Fable 5 za poloviční cenu. Na ARC-AGI 3 skóruje třikrát výš než nejbližší konkurence. A na OSWorld 2.0 — benchmarku pro autonomní ovládání počítače — porazí Fable 5 za třetinovou cenu. To vše za stejnou cenu 5 $ / 25 $ za milion tokenů, se kterou vyšel Opus 4.8.
Právě tahle kombinace — špičkové schopnosti za neškatulkovou cenu — je to, na čem záleží každému, kdo na těchto modelech staví produkty, ne jen těm, kdo je používají na chat.
Vylepšení, které mě z celého článku zaujalo nejvíc, není číslo z benchmarku, ale chování: Opus 5 je výrazně lepší v ověřování vlastní práce — iteruje, dokud něco skutečně nefunguje, místo aby se zastavil u „vypadá to dobře“. Přesně tahle mezera se nejčastěji objevovala v mé vlastní práci na multi-agentních systémech a AI nástrojích. Agenti, kteří dokážou zachytit vlastní chyby uprostřed úkolu, jsou úplně jiná kategorie užitečnosti než ti, co jen vyplivnou první odpověď.
Pár dalších postřehů pro ty, kdo staví na tomhle modelu: silnější výkon ve vědeckém/technickém uvažování (organická chemie, analýza proteinů), citelný skok v kvalitě vizuálních/kreativních výstupů a „rychlý režim“ na 2,5násobnou rychlost za dvojnásobnou cenu, když záleží víc na latenci než na ceně.
Během pár následujících dní ho proženeme reálnými agentními workflow — jakmile ho dostaneme za hranice benchmarkových čísel, dáme vědět.