Tại sao Fable 5 đốt ngân sách nhanh hơn dự kiến?

Claude Fable 5 (Mythos-class công khai đầu tiên của Anthropic) được thiết kế cho công việc dài hơi, phức tạp: large-scale code migration, multi-day research agent, autonomous knowledge work. Nó dẫn đầu SWE-Bench Pro (~80.3%, +11 điểm so Opus 4.8) và các benchmark FrontierCode cho task khó.

Nhưng giá API là $10/M input và $50/M output — gấp đôi Claude Opus 4.8. Quan trọng hơn: Fable "nghĩ" nhiều hơn, sinh nhiều token hơn cho cùng output vì quá trình reasoning sâu. Nhiều người dùng Max plan báo burn 2%/phút chỉ với một session agentic. Một query end-user phức tạp có thể fan-out thành hàng chục triệu tokens khi có planning + sub-calls + verify + retry.

Fable 5 không phải model mặc định cho mọi agent task

2× giá + reasoning dài → một session phức tạp dễ đốt vài USD chỉ cho 1 query. Bắt buộc có router, cache và hard cap trước khi enable cho team hoặc production.

Cost-aware routing là bắt buộc, không phải tùy chọn

Trong thực tế production, 60-70% task của một agent harness không cần intelligence Mythos-class. Phần lớn là retrieval, formatting, simple tool calls, summarization — những việc Sonnet/Haiku, hoặc thậm chí local diffusion model (như DiffusionGemma mới ra) làm tốt với chi phí thấp hơn rất nhiều.

Pattern tối ưu:

  • Classifier / router layer đầu tiên phân loại độ phức tạp (nhẹ / trung / dài hạn / cần verification cao).
  • Default path: model rẻ + cache 90% prompt (Anthropic hỗ trợ mạnh).
  • Escalate chỉ khi router detect cần depth (ví dụ: sửa bug phức tạp, phân tích multi-file với 100k+ context, tự thiết kế workflow mới).
  • Luôn có hard cap USD/task và timeout để tránh runaway cost.
Claude Fable 5
  • SWE-Bench Pro ~80% (+11pts)
  • $10 / $50 per M tokens
  • Lead long-horizon, complex multi-step
  • 1M context, high autonomy
Claude Opus 4.8
  • Base cho đa số workload ổn định
  • $5 / $25 per M tokens
  • Đủ cho refactor, coding thông thường
  • Burn rate thấp hơn, dễ predict
Fable 5 vs Opus 4.8 — khi intelligence premium đáng giá

Khi nào KHÔNG nên dùng Fable 5

  • Task có pattern lặp lại cao (data transform, report template) → cache + lighter model đủ.
  • Yêu cầu latency thấp hoặc high-volume (chat support, real-time decision) → diffusion hoặc SLM local thắng.
  • Ngân sách hạn chế hoặc cần predict cost chặt → routing + smaller models là lựa chọn duy nhất bền vững.

Fable 5 tỏa sáng khi task có horizon dài, cần "taste" code hoặc quyết định nhiều bước với ít ví dụ, và outcome có giá trị kinh tế rõ (giảm manual effort hàng giờ, ít lỗi prod). Khi đó, 2x giá có thể rẻ hơn chi phí nhân sự hoặc downtime.

  1. 1ClassifyIntent nhẹ / trung bình / dài hạn / cần verify cao
  2. 2Cheap pathSonnet/Haiku hoặc local diffusion trước
  3. 3EscalateChỉ gọi Fable khi router detect cần depth sâu
  4. 4GuardSpending cap + cache + verification step
Quy trình routing tối ưu cho agent production

Kết luận thực dụng

Bắt đầu bằng việc đo burn rate thực tế trên 50-100 task điển hình của bạn với Fable trước khi bật cho toàn team. Thiết kế router + cache + cap từ ngày đầu. Chỉ scale Fable (hoặc Mythos restricted) cho những workflow thực sự cần nó. Frontier model là công cụ mạnh, nhưng không phải búa để đóng mọi đinh — engineer giỏi là người biết khi nào KHÔNG dùng nó.

Hybrid là thực tế, không phải lý thuyết

Kết hợp Fable cho core reasoning + DiffusionGemma/Kimi local swarm cho parallel subtask hoặc data prep cho phép vừa giữ chất lượng vừa kiểm soát chi phí và latency.