AI

AnthropicのFable 5.1、キャッシュコストを75%削減―エージェント型ベンチマークは倍増以上

Susan Hill

Anthropicは9月1日、ClaudeをFable 5.1にアップデートし、キャッシュされた入力トークンのコストを100万トークンあたり1.00ドルから0.25ドルへと75%削減した。この値下げは、多くのプロダクションAI開発者が、生の計算処理ではなくコンテキストの蓄積こそがインフラ予算の大半を占めることに気づいたまさにその時に行われた。ライブのエージェントセッションでは、単一のClaudeの会話がターンを重ねるごとに数十万トークンのコンテキストをキャッシュに保持することができる。0.25ドル/100万トークンという価格により、この蓄積は開発者が回避しなければならないコスト上限ではなく、意図的な設計選択となる。

価格変更に伴うベンチマーク結果は、経済的メリットをさらに強化するパフォーマンスの向上を示している。実験計画と反復分析を必要とする多段階の科学的推論を測定するTerminal-Bench-Science 0.1では、Fable 5.1が52.6%を記録し、Fable 5の24.7%に対して2倍以上の結果となった。AutomationBenchは17.1%から31.4%に改善し、より広範なエージェント能力評価であるTerminal-Bench 4.0は42.0%から55.8%に上昇した。CursorBench 3.2.0は73.4%となった。これら4つの評価に共通するパターンは明確である。Fable 5.1は限界的にわずかに改善されたわけではなく、エージェント価値を定義するタスクのカテゴリにおいて、大幅に信頼性が向上している。

この複合効果により、Claudeを使った構築のコスト計算は書き換えられる。モデルがより信頼性が高いために、より少ないターンでタスクを完了するエージェントアプリケーションは、成功結果に至るまでに消費するトークンサイクル全体が少なくなる。使用するトークンに75%のキャッシュ削減を適用すると、再利用性の高いエージェントワークフローにおける実効的なタスクあたりのコスト削減は45%以上に達する。Anthropicは複合的な節約の単一のヘッドライン数値を公表していないが、自社のトークン経済をモデル化する開発者は、コンテキストが重いワークロードにおいてその範囲の数字に到達するだろう。

Fable 5.1は、Anthropicの直接API(モデル識別子claude-fable-5-1)を通じて、またAmazon Web Services Bedrock、Google Cloud Platform、Microsoft Azureを通じて即座に利用可能である。Anthropicは同時にEnterprise Frontier Safeguardsを発表した。これは、顧客管理のデータ保持、顧客管理の暗号化キー、各顧客の既存のクラウドインフラテナント内でのデプロイを含み、基本となるクラウドコスト以外の追加料金は不要である。

一般公開と同時に、AnthropicはMythos 5.1を導入した。これは、審査済みの組織向けに同社が「より緩やかなセーフガード」と説明するものを備えた、同じ基本モデルのバリアントである。アクセスは、認証されたサイバーセキュリティ研究機関とライフサイエンス企業に制限されている。同社は、実証済みのアプリケーションとして、タンパク質結合体設計や生物学的モデルの最適化を挙げ、標準リリースの最大2.5倍の推論スループットを実現したとしている。Mythos 5.1へのアクセスはセルフサービスではなく、Anthropicが個別に申請を審査しており、登録コホートの規模は公表されていない。

Fable 5.1のエージェント数値、特にTerminal-Bench-Scienceにおける数値は、Anthropicの公表結果を、同等の評価におけるOpenAIの最新の開示数値よりも上位に位置づけている。企業間のベンチマーク比較には方法論上の注意が必要である。ベンダーは自社モデルに有利な評価を選択するものであり、Anthropicが強調した特定のテストは、おそらく好ましい結果が得られたものが選ばれたのだろう。しかし、内部の倍増パターンは説明が難しい。Fable 5.1は、価格引き下げが付随した同じモデルではない。パフォーマンスの変化は十分に大きく、価格の話とパフォーマンスの話を切り離すことはできない。

現在Claudeを使用していない開発者にとって、キャッシュ価格の改定は、自社のトークン経済に当てはめる価値のある数字である。100万キャッシュトークンあたり0.25ドルに迫っていないAIプロバイダーは、今後エンタープライズ営業の場で直接的なコスト比較の質問に直面することになる。Anthropicのキャッシュ価格は今回の値下げ前からすでに競合他社数社よりも低かったが、その差はさらに広がった。パフォーマンスの向上はユースケース全体に一般化するのは難しいが、エージェントおよび科学的推論セグメントにおいて、Fable 5.1は、今後どのプロバイダーが次にリリースするメジャーバージョンも対して測定されるベンチマーク水準を設定した。

タグ: , , , ,

ディスカッション

0件のコメントがあります。