Az új modellek olyan feladatokhoz készültek, amelyek „órákat vesznek igénybe, nem másodperceket”

Előre tekintve: Az Anthropic kiadta a Claude Fable 5.1-et, amely legújabb csúcsmodelljét API-ján, felhőplatformjain és a Claude asztali alkalmazáson keresztül elérhetővé tette. Kiadta a Mythos 5.1-et is, amely ugyanannak az alapul szolgáló modellnek a verziója, amelyet jóváhagyott kiberbiztonsági és élettudományi szervezetek számára tartanak fenn. Ezek a frissítések megkönnyítik az Anthropic legfejlettebb modelljeit a vállalatok számára, hogy olyan összetett munkát végezzenek, amely időigényes, érzékeny adatokat tartalmaz, és egyértelmű biztosítékokat igényel.

A Fable 5.1 a széles körben elérhető verzió, olyan biztosítékokkal, amelyek megakadályozzák a kiberbiztonság és a tudományos kutatás bizonyos magas kockázatú munkáit. A Mythos 5.1 kevesebb ilyen korlátozást tartalmaz, de a hozzáférés az Anthropic megbízható hozzáférésű programjára korlátozódik.

A frissítés az AI-t használó ügyfeleket célozza meg egyetlen promptnál vagy kódkérésnél nagyobb feladatokhoz. Az Anthropic szerint a Fable 5.1 jobb a szoftverprojektek kezelésében, az alkalmazások kódjának áttekintésében, a külső könyvtárak problémáinak elhárításában és a többlépcsős tudományos munka futtatásában. Segíthet a kísérletek tervezésében, a lehetséges eredmények modellezésében és a részletes táblázatok és diagramok értelmezésében is.

A vállalat szerint a modellt úgy tervezték, hogy több munkát végezzen el kevesebb token használatával, ami kulcsfontosságú probléma az AI-ügynököket hosszabb ideig működtető vállalatok számára.

Az Anthropic jelentős nyereségről számolt be számos belső és harmadik fél által készített értékelés során. A Fable 5.1 55,8%-ot ért el a Terminal-Bench 4.0-n, amely a parancssori kódolási munka mércéje, szemben a Fable 5 42%-ával. A Mythos 5.1 60,9%-ot ért el a megengedőbb biztonsági beállításai mellett.

Az ügynöki tudományos kutatást mérő Terminal-Bench-Science 0.1-en az Anthropic 52,6%-os eredményt ért el a Fable 5.1-nél, ami több mint kétszerese a Fable 5 24,7%-ának. A vállalat az üzleti munkafolyamatok automatizálása, a tudásmunka és a böngésző-ügynöki feladatok terén is növekedésről számolt be.

Ezek a benchmark eredmények az Anthropic sajátjai, és nem szabad független bizonyítékként kezelni, hogy az új modell jobb minden versenytárs rendszernél. Mindazonáltal az eredmények összhangban vannak a vállalat szélesebb körű állításával, miszerint a Fable 5.1 jobban megfelel az olyan munkákhoz, amelyek modellt igényelnek a probléma nyomon követéséhez, eszközök használatához és a korábbi lépések újragondolásához.

Néhány korai vásárló leírta ezt a fajta használatot. A Millennium szerint a Fable 5.1 egy ritka szoftverösszeomlás okát egy külső gyártó könyvtárában találta meg, miután a probléma négy-öt évig megmagyarázhatatlan volt. Ramp azt mondta, hogy 38 órán keresztül futtatta a modellt egy gépi tanulási feladaton, amely során felülvizsgálta egy korábbi következtetését, elindított hat kísérletet, és eredményeket és ajánlásokat készített.

Az Anthropic nem csökkentette a Fable 5.1 szabványos API-rátait. Továbbra is 10 dollárba kerül millió bemeneti tokenenként és 50 dollárba egy millió kimeneti tokenenként, ugyanannyit, mint a Fable 5.

Ehelyett a vállalat 75%-kal csökkentette a gyorsítótár-olvasás árát. A gyorsítótárazott bemenet olvasása most 0,25 dollárba kerül milliónként, szemben a Fable 5 esetében 1 millió dollárral. A gyorsítótár írása továbbra is 12,50 dollár millió tokenenként egy ötperces gyorsítótár esetén, és 20 dollár millió tokenenként egy egyórás gyorsítótár esetén.

Ez a változás fontos az ügynöki munkaterheléseknél, mert az ügynökök gyakran ugyanazt az információt küldik el egy modellnek. Ez magában foglalhat egy nagy kódtárat, rendszerutasításokat, műszaki dokumentációt, szerszámspecifikációkat és a korábbi munkák nyilvántartását. Az ismétlődő kontextus árának csökkentése jelentős mértékben befolyásolhatja a teljes számlát.

Az antropikus említett gyorsítótárban tárolt anyagok bizonyos hosszú feladatok során a tokenhasználat felét vagy többet is kiadhatnak. A vállalat arra számít, hogy az új árazás körülbelül 25%-kal csökkenti a Fable 5.1 futtatásának tényleges költségét a tipikus munkaterhelések esetén, és akár 45%-kal az erősen ügynöki alkalmazások esetében.

A Fable továbbra is drága az Anthropic Opus és Sonnet modelljeivel, valamint sok versengő modelljével összehasonlítva. A vállalat azonban arra fogad, hogy a vállalkozások egy nehéz feladat elvégzésének költségei alapján ítélik meg, nem csak az egyes token ára alapján.

A kiadás az Anthropic adatmegőrzési megközelítésében is változásokat tartalmaz. Idén ősszel a vállalat azt tervezi, hogy elkezdi kínálni az Enterprise Frontier Safeguards szolgáltatást, amely lehetővé teszi az ügyfelek számára, hogy saját infrastruktúrájukon megfigyeljék adataikat, miközben továbbra is használják az Anthropic visszaélés-érzékelő rendszereit.

Ez eltolódást jelent az Anthropic korábbi álláspontjához képest, amely szerint bizonyos fejlett modelleknél a kiberbiztonsági kockázatok miatt adatmegőrzésre volt szükség. Az új megállapodás értelmében az ügyfelek nagyobb mértékben ellenőrizhetik az adatokat és a naplózást, miközben az Anthropic biztonsági ellenőrzései továbbra is aktívak maradnak.

Az Anthropic azt is elmondta, hogy javította azokat az osztályozókat, amelyek eldöntik, hogy blokkolják-e a modellkérést. A vállalat szerint az új rendszer kevesebb téves pozitív eredményt produkál, ami csökkentheti a jogos kiberbiztonsági és biológiával kapcsolatos munka szükségtelen megszakításait.

A probléma azután vált még jelentősebbé, hogy az Anthropic és az Egyesült Királyság AI Security Institute nyilvánosságra hozta, hogy a szokatlanul megengedő kiberbiztonsági feltételek mellett tesztelt korábbi Claude modellek jogosulatlan lépéseket tettek valós rendszerek ellen. Az Anthropic ideiglenesen felfüggesztette a külső kiberértékeléseket, és további korlátozásokat és felügyeletet biztosított az újraindításuk előtt.

A Fable 5.1 és a Mythos 5.1 az első olyan Claude modell, amely láthatatlan vízjeleket tartalmaz a szöveges és fájlkimenetekben. Az Anthropic azt mondta, hogy az EU AI-törvényével összhangban vízjelet ad a 2026. augusztus 2. után kiadott modellekhez.

A vízjelek úgy működnek, hogy befolyásolják a szóválasztást, ha több elfogadható választási lehetőség áll rendelkezésre. Céljuk, hogy másolás, beillesztés vagy könnyű szerkesztés után is észlelhetők maradjanak, de az olvasók számára nem láthatók.

Az Anthropic szerint a vízjel nem változtatja meg a válasz minőségét vagy tartalmát, és nem tartalmaz információkat a felhasználóról, a szervezetről vagy a beszélgetésről. Az észlelési API elérhető a szabályozó hatóságok, a bűnüldöző szervek, a médiaszervezetek, a tényellenőrzők, a független kutatók és más jogosult csoportok számára.

A pozitív eredmény azt mutathatja, hogy Claude írta vagy feldolgozta a tartalmat. A vízjel hiánya azonban nem bizonyítja, hogy ember írta az anyagot.