Claude Opus 5 vượt trội hơn Fable 5 về hiệu năng trong các bài benchmark, với mức giá chỉ bằng một nửa

BABA-1,64%
Key Takeaways
  • Anthropic ra mắt Claude Opus 5 vào ngày 24 tháng 7, với giá 5 USD cho mỗi 1 triệu token đầu vào, bằng một nửa chi phí của Fable 5.
  • Opus 5 đạt 43,3% trên Frontier-Bench v0.1, so với 33,7% của Fable 5 và 34,4% của GPT-5.6 Sol.
  • Opus 5 trở thành cấu hình mặc định trên Claude Max, thay thế Fable 5 sau các gián đoạn vận hành của phiên bản này.

Anthropic đã phát hành Claude Opus 5 vào ngày 24 tháng 7, với giá 5 USD cho mỗi 1 triệu token đầu vào—bằng một nửa chi phí so với mẫu trước đó Claude Fable 5—đồng thời vượt trội Fable 5 ở hầu hết các bài benchmark lớn. Opus 5 đạt 43,3% trên Frontier-Bench v0.1, bài đánh giá coding theo hướng tác nhân, so với 33,7% của Fable 5 và 34,4% của OpenAI GPT-5.6 Sol; trên ARC-AGI-3, một benchmark giải quyết vấn đề mới lạ, nó đạt 30,2% so với 7,8% của GPT-5.6 Sol. Mô hình mới trở thành mặc định trên Claude Max và là lựa chọn mạnh nhất trên Claude Pro, thay thế hiệu quả Fable 5 như lựa chọn mặc định cho phần lớn người đăng ký sau các gián đoạn vận hành của Fable 5 trong đầu mùa hè này.

Danh mục của Anthropic có bốn tầng: Haiku nhanh và rẻ, Sonnet tầm trung, Opus là “trâu cày” hạng nặng, và lớp Mythos—được giới thiệu trong mùa xuân này—gồm Claude Fable 5 cho công chúng và Claude Mythos 5 dành cho các nhà nghiên cứu an ninh mạng đã được thẩm định cùng các nhà điều hành hạ tầng trọng yếu thông qua Project Glasswing.

Claude Opus 5 Vượt Trội Fable 5 Ở Các Benchmark Lớn

Trên Frontier-Bench v0.1, bài kiểm tra liệu các tác nhân coding của AI có thể hoàn thành các tác vụ kỹ sư phần mềm ngoài đời thực từ đầu đến cuối hay không, Opus 5 đạt 43,3%. Fable 5 đạt 33,7% và OpenAI GPT-5.6 Sol đạt 34,4%.

Biên độ lớn nhất xuất hiện trên ARC-AGI-3, bài kiểm tra giải quyết vấn đề được xây dựng xung quanh các câu đố mới lạ mà một mô hình không thể chỉ “học thuộc” từ dữ liệu huấn luyện. Opus 5 đạt 30,2%; GPT-5.6 Sol đạt 7,8%; Fable 5 không được thử nghiệm.

Trên GDPval-AA v2, một benchmark đánh giá công việc tri thức được chấm theo thang Elo dùng để đo hiệu năng tương đối trong các tác vụ nghề nghiệp thực tế, Opus 5 đạt 1.861 so với 1.747 của Fable 5 và 1.736 của GPT-5.6 Sol.

Theo các benchmark được Anthropic công bố, Fable 5 chỉ vượt Opus 5 với biên độ nhỏ trong các bài đánh giá liên quan đến pháp lý và sức khỏe.

Anthropic Định Giá Opus 5 Ở 5 USD Mỗi 1 Triệu Token Đầu Vào

Opus 5 có sẵn qua API với giá 5 USD cho mỗi 1 triệu token đầu vào và 25 USD cho mỗi 1 triệu token đầu ra. Chế độ Fast có tốc độ khoảng 2,5 lần so với mặc định, hiện có ở mức gấp đôi giá cơ sở—10 USD cho mỗi 1 triệu token đầu vào và 50 USD cho mỗi 1 triệu token đầu ra.

Mức giá này tương ứng với Opus 4.8 và thấp hơn đúng một nửa chi phí của Fable 5, mẫu mà Anthropic đã định vị như sản phẩm “frontier” hằng ngày cho người dùng trả phí.

Fable 5 Bị Rút Khỏi Toàn Cầu Sau Lệnh Kiểm Soát Xuất Khẩu

Fable 5 ra mắt ngày 9 tháng 6, bị rút khỏi toàn cầu ba ngày sau đó sau khi chính phủ Mỹ ban hành lệnh kiểm soát xuất khẩu khẩn cấp, nêu lý do có lỗ hổng jailbreak, và quay trở lại vào ngày 30 tháng 6. Khi quay trở lại, nó ngay lập tức chuyển sang mô hình chỉ dùng tín dụng, không còn được đưa vào các gói tiêu chuẩn.

Opus 5 hiện đang lấp chỗ trống mà Fable 5 không thể giữ với vai trò “lá cờ” dành cho người đăng ký.

Nền Tảng Bên Thứ Ba Xác Nhận Tăng Hiệu Năng Của Opus 5

Lovable, một nền tảng phát triển với hàng triệu người dùng, đã chạy Opus 5 trong các đánh giá nội bộ. “Nó không chỉ tốt hơn ở các tác vụ coding theo hướng tác nhân khó nhất của chúng tôi, tăng 22% so với Opus 4.7, mà còn ổn định hơn, với mức biến thiên giữa các lần chạy thấp hơn rất nhiều”, Fabian Hedin cho biết trong một tuyên bố được chia sẻ bởi Anthropic.

Zapier đã thử nghiệm Opus 5 trên AutomationBench, một bài đánh giá xem liệu một mô hình có thể thực hiện trọn vẹn một quy trình công việc kinh doanh từ đầu đến cuối mà không cần con người hay không. Mô hình “lấy một workbook thô về sức khỏe tài khoản và chạy toàn bộ chuỗi phòng chống churn từ đầu đến cuối: gắn cờ các tài khoản có rủi ro, cảnh báo đúng người sở hữu, và tóm tắt cho hoạt động retention ops. Các mô hình trước đó không đạt; Opus 5 đạt 100%.”

Ultima Genomics, một công ty giải trình tự DNA, cho biết mô hình “cư xử giống như một nhà khoa học cẩn trọng hơn bất kỳ mô hình nào chúng tôi từng chạy. Nó tìm đến đúng các phép thử thống kê để loại trừ yếu tố gây nhiễu, đối chiếu kết quả của chính nó bằng các phương pháp độc lập, và bám sát lộ trình trong các phân tích dài nhiều bước.”

Bản phát hành này rơi vào một tuần sau khi Moonshot AI, một startup có trụ sở ở Bắc Kinh được hậu thuẫn bởi Alibaba, công bố Kimi K3—một mô hình open-weight với 2,8 nghìn tỷ tham số—mà Moonshot mô tả là hệ AI mã nguồn mở lớn nhất thế giới. Các benchmark độc lập liên tục xếp Kimi K3 ở vị trí thứ ba tổng thể, sau cả Fable 5 và GPT-5.6 Sol, và vượt hai mô hình này ở các lĩnh vực cụ thể.

Câu hỏi thường gặp

Claude Opus 5 đã vượt trội Fable 5 ở những benchmark nào?

Claude Opus 5 đạt 43,3% trên Frontier-Bench v0.1 so với 33,7% của Fable 5, 30,2% trên ARC-AGI-3 (Fable 5 không được thử nghiệm), và 1.861 trên GDPval-AA v2 so với 1.747 của Fable 5. Fable 5 chỉ vượt Opus 5 với biên độ nhỏ trong các đánh giá liên quan đến pháp lý và sức khỏe.

Claude Opus 5 có giá bao nhiêu so với Fable 5?

Claude Opus 5 có giá 5 USD cho mỗi 1 triệu token đầu vào và 25 USD cho mỗi 1 triệu token đầu ra qua API—thấp hơn đúng một nửa chi phí được ngụ ý của Fable 5. Chế độ Fast có sẵn ở mức 10 USD cho mỗi 1 triệu token đầu vào và 50 USD cho mỗi 1 triệu token đầu ra.

Vì sao Claude Fable 5 bị rút khỏi khả dụng toàn cầu?

Fable 5 ra mắt ngày 9 tháng 6 và bị rút khỏi toàn cầu ba ngày sau đó sau khi chính phủ Mỹ ban hành lệnh kiểm soát xuất khẩu khẩn cấp, nêu lý do có lỗ hổng jailbreak. Nó quay trở lại vào ngày 30 tháng 6 dưới dạng mô hình chỉ dùng tín dụng, không còn nằm trong các gói tiêu chuẩn.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể đến từ các nguồn bên thứ ba và chỉ mang tính chất tham khảo. Thông tin này không phản ánh quan điểm hoặc ý kiến của Gate và không cấu thành bất kỳ lời khuyên tài chính, đầu tư hoặc pháp lý nào. Giao dịch tài sản ảo tiềm ẩn rủi ro cao. Vui lòng không chỉ dựa vào thông tin trên trang này khi đưa ra quyết định. Để biết thêm chi tiết, vui lòng xem Tuyên bố miễn trừ trách nhiệm.
Bình luận
0/400
Không có bình luận