Quay lại trang tin tức

Claude Opus 4.7 ra mắt mạnh hơn nhưng đốt token hơn

Xuất bản vào 17 tháng 04, 2026
Claude Opus 4.7 ra mắt mạnh hơn nhưng đốt token hơn

Tóm tắt nhanh

Anthropic chính thức ra mắt Claude Opus 4.7, phiên bản nâng cấp mạnh mẽ cho dòng Opus với cải tiến vượt bậc về khả năng lập trình và thị giác, tuy nhiên đi kèm với việc tiêu tốn nhiều token hơn do tokenizer mới và chiều sâu suy luận được tăng cường.

Anthropic đã cho ra mắt Claude Opus 4.7 với hàng loạt cải tiến thực chất nhưng có một cảnh báo mà Anthropic ghi thẳng vào tài liệu migration: tokenizer mới có thể tạo ra nhiều hơn 1.0–1.35 lần token so với cùng nội dung đó trên Claude Opus 4.6, và model suy nghĩ nhiều hơn ở các mức effort cao. Nếu bạn đang dùng API và chưa đọc kỹ điều này trước khi nâng cấp, hóa đơn tháng tới sẽ là bài học đắt giá nhất bạn nhận được từ AI.

Opus 4.7 cải thiện gì so với 4.6?

Các con số thực tế từ tester

Anthropic cho phép nhiều công ty tiếp cận sớm và thu thập phản hồi trước khi phát hành. Đây không phải marketing một chiều — các công ty ghi lại kết quả đo lường cụ thể

  • Cursor: Opus 4.7 đạt 70% trên CursorBench, tăng đáng kể so với 58% của Opus 4.6 — một bước nhảy hiếm thấy giữa hai phiên bản liên tiếp.
  • Notion: Tăng 14% so với Opus 4.6 trong các workflow nhiều bước, đồng thời tiêu ít token hơn và chỉ còn 1/3 số lỗi tool. Đây là trường hợp hiếm gặp khi model mới tốt hơn đồng thời trên cả ba chiều: chất lượng, chi phí và độ ổn định.
  • XBOW: Benchmark visual acuity tăng từ 54.5% lên 98.5% — gần như tăng gấp đôi. Đây là cải thiện lớn nhất được ghi nhận và là lý do XBOW có thể mở rộng sang cả lớp công việc computer-use mà trước đây không thể dùng Opus.
  • Rakuten: Giải quyết được gấp 3 lần số task production so với Opus 4.6 trên benchmark riêng của họ.

Tuy nhiên những con số này đến từ các công ty đã được chọn để test sớm và có động lực công bố kết quả tốt. Benchmark nội bộ của từng công ty không thể so sánh trực tiếp với nhau và chưa chắc phản ánh đúng workflow của bạn.

Điểm số benchmarks của Claude Opus 4.7 (nguồn Anthropic)
Điểm số benchmarks của Claude Opus 4.7 (nguồn Anthropic)

Ba thay đổi hành vi đáng chú ý nhất

Tuân thủ hướng dẫn theo nghĩa đen — cả tốt lẫn xấu. Anthropic ghi rõ trong tài liệu phát hành: Opus 4.7 thực thi hướng dẫn chính xác hơn đến mức "các prompt viết cho model cũ có thể tạo ra kết quả ngoài mong đợi vì chỗ nào model cũ bỏ qua hoặc diễn giải linh hoạt thì Opus 4.7 làm đúng nghĩa đen". Với developer, điều này có nghĩa là nếu system prompt của bạn có rule mơ hồ hay mâu thuẫn, Opus 4.7 sẽ đề cập ngay thay vì tự giải quyết trong im lặng như trước. Đây là cải thiện về độ tin cậy, nhưng đòi hỏi bạn phải xem lại lại toàn bộ prompt trước khi deploy.

Ví dụ từ Vercel: "Opus 4.7 thậm chí tự viết proof cho systems code trước khi bắt đầu làm — đây là hành vi mới chưa thấy ở các Claude trước." Model không chỉ làm việc theo yêu cầu mà tự thêm bước xác nhận đầu ra trước khi báo cáo kết quả.

Ít nịnh bợ và phản hồi sáo rỗng hơn. Hex đã xác nhận: "Nó báo cáo đúng khi dữ liệu bị thiếu thay vì đưa ra câu trả lời nghe có vẻ đúng nhưng thực ra là bịa." thực sự mình đã thử thật sự là không hề thấy xuất hiện những câu nịnh bợ sáo rỗng như “bạn thật tuyệt vời” hoặc “bạn thực sự hơn 95% người trên thế giới này” và thiếu thông tin chắc chắn nó sẽ hỏi lại bạn, vậy là Opus 4.7 có vẻ cải thiện đáng kể điểm này trong khi Opus 4.6 nhiều lúc vẫn bị những câu nịnh bợ hoặc bịa ra thông tin không chính xác, điều này giúp cho nó hoàn toàn có thể trở thành đồng nghiệp mới của mình giống như Replit mô tả: "Nó phản bác trong các cuộc thảo luận kỹ thuật để giúp tôi đưa ra quyết định tốt hơn. Thực sự cảm giác như một đồng nghiệp tốt hơn."

Xử lý hình ảnh độ phân giải cao gấp 3 lần. Opus 4.7 chấp nhận ảnh lên đến 2.576 pixel trên cạnh dài (khoảng 3.75 megapixel), tăng hơn 3 lần so với các model Claude trước. Điều này không phải là tham số API mà là thay đổi ở cấp độ model, nghĩa là ảnh bạn gửi lên sẽ tự động được xử lý ở độ phân giải cao hơn so với trước đây. Điều này có nghĩa là Opus 4.7 có thể phân tích tài liệu có biểu đồ nhỏ, đọc code từ screenshot, hay computer-use với màn hình độ phân giải cao hơn so với các model trước.

Ví dụ mình đã thử với file pdf nhiều trang và có những chữ kí nhỏ thì Opus 4.7 hoàn toàn có thể nhận diện được chính xác những chữ kí nhỏ này, rồi sau đó là sử dụng chrome để nhận diện các kí tự nhỏ ở web thì nó có thể nhận diện chính xác hơn. Tuy nhiên điều này tốn token cực kì có thể khoảng 3 hoặc 4 lần chat là hết quota ngay lập tức vì vậy mọi người có thể cân nhắc giảm kích thước ảnh trước khi gửi nếu không cần độ chi tiết cao.

Vấn đề token vẫn là thứ đáng lo nhất với người dùng

Tokenizer mới tạo ra nhiều token hơn từ cùng nội dung

Anthropic thừa nhận thẳng thắn trong migration guide: Opus 4.7 dùng tokenizer mới được cải tiến, nhưng trade-off là cùng một đoạn text có thể tạo ra nhiều hơn 1.0–1.35 lần token so với Opus 4.6. Hệ số 1.35 nghe có vẻ nhỏ nhưng trên quy mô production thì không phải vậy — nếu hệ thống của bạn đang tiêu 10 triệu token mỗi ngày với Opus 4.6, sau khi nâng cấp bạn có thể tiêu 13.5 triệu token mà không thay đổi gì về nội dung hay workflow. Vì vậy những ai chỉ chạy bản Pro thì có vẻ quota sẽ hoàn toàn không đủ có lẽ Anthropic đang ép người dùng phải nâng cấp lên Max để làm việc.

Kết hợp với việc model suy nghĩ nhiều hơn ở các mức effort cao (đặc biệt ở `xhigh` — effort level mới được thêm vào giữa `high` và `max`), và mặc định Claude Code đã nâng lên `xhigh` cho tất cả các plan vì vậy người dùng API cần đo lường thực tế trên traffic thật trước khi nâng cấp toàn bộ, không nên dựa vào ước tính lý thuyết.

Biểu đồ so sánh effort của Claude Opus 4.6 và Opus 4.7
Biểu đồ so sánh effort của Claude Opus 4.6 và Opus 4.7

Task budgets là công cụ kiểm soát mới cho API

Song song với Opus 4.7, Anthropic ra mắt tính năng task budgets (public beta) trên Claude Platform, cho phép người dùng đặt giới hạn token cho từng task thay vì toàn bộ session. Đây là phản hồi trực tiếp với vấn đề nhiều pipeline bị "cháy" quota vì agent chạy quá lâu trên các task phức tạp mà không có cơ chế dừng. Với Opus 4.7 suy nghĩ nhiều hơn, task budgets sẽ trở thành công cụ cần thiết để kiểm soát chi phí thay vì tùy chọn.

Nhìn nhận lại Claude Opus 4.7

Trong khi cộng đồng đang bàn về Opus 4.7 với khả năng đốt token khủng khiếp hay việc Opus 4.6 đang gặp lỗi. Đặc biệt với người dùng API đang vận hành workflow thì sự ổn định thường quan trọng hơn khả năng benchmark đi kèm thêm chi phí phải được tối ưu và không có bất ngờ nào vượt quá tầm kiểm soát.

Cho nên đừng nói đến việc nâng cấp Opus 4.7 ngay lập tức vì một model mới tốt hơn nhưng thỉnh thoảng đầu ra không nhất quán thực sự quá khó để kiểm soát so với các model cũ đã được kiểm chứng.

Nếu bạn đang cân nhắc nên dùng model nào trong tháng tới, đây là hướng dẫn thực tế: thử Opus 4.7 trên 10–20% traffic với task budgets bật lên, đo lường chi phí token thực tế so và chỉ chuyển toàn bộ sau khi có đủ dữ liệu. Đừng để điểm số hoặc những bài test ban đầu quyết định thay trong công việc lựa chọn của bạn.

Có một điều cũng đáng lưu ý: Opus 4.7 nên để ở 200k token thay vì đẩy lên 1 triệu token ngay vì ở context window lớn, model suy nghĩ nhiều hơn ở mỗi lượt sau và token tích lũy nhanh hơn bạn nghĩ — đặc biệt trong các agentic workflow nhiều lượt thực hiện, khi đó chi phí đi kèm sẽ tăng lên cấp số nhân nên bạn phải rất cẩn thận.

Thảo luận (0)

Đăng nhập để tham gia thảo luận.

Chưa có bình luận nào. Hãy là người đầu tiên!

Các bài viết liên quan

Claude Opus 5 ra mắt với sức mạnh áp sát Fable 5

Anthropic vừa ra mắt Claude Opus 5 với mức giá giữ nguyên như Opus 4.8 nhưng chất lượng trả lời được nâng lên gần bằng Fable 5, model đắt gấp đôi. Nói cách khác, với mức giá bằng một nửa Fable 5 mà hiệu năng lại áp sát, phần lớn người dùng nhiều khả năng sẽ chọn Opus 5 làm model mặc định, chỉ giữ Fable 5 cho số ít tác vụ thật sự cần đến giới hạn cao nhất. Claude Opus 5 mang đến những nâng cấp nào? Theo thông báo ra mắt của Anthropic, Claude Opus 5 là model Opus mạnh nhất tính đến nay và là đại diện đầu tiên của dòng Opus thuộc thế hệ Claude 5. Anthropic mô tả đây là model chủ động, biết suy nghĩ sâu và tiến gần trí tuệ cấp cao nhất của Claude Fable 5 trong nhiều lĩnh vực, nhưng chỉ tốn một nửa chi phí token. Model có mã API claude-opus-5, context mặc định và tối đa 1 triệu token, tương tự Opus 4.8 và Fable 5, cùng giới hạn đầu ra 128.000 token và chế độ thinking được bật mặc định. Nó đã trở thành model mặc định trên Claude Max và là model mạnh nhất khả dụng trên Claude Pro, đồng thời có mặt trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và cả GitHub Copilot. Vì sao nhiều người sẽ chọn Opus 5 thay vì Fable 5? Câu trả lời không chỉ nằm ở con số giá. Có bốn lý do khiến Opus 5 nhiều khả năng trở thành lựa chọn mặc định cho công việc hằng ngày, trong khi Fable 5 lùi về vai trò công cụ chuyên dụng cho số ít trường hợp đặc biệt. Thắng nhiều hơn thua trên các bài kiểm tra thực tế Trên Frontier-Bench v0.1, bài kiểm tra coding tự động của chính Anthropic, Opus 5 đạt 43,3% trong khi Fable 5 chỉ đạt 33,7%, một khoảng cách gần 10 điểm nghiêng hẳn về Opus 5. Trên CursorBench 3.2 ở mức effort tối đa, Opus 5 đạt khoảng 70,1%, thua Fable 5 chưa tới nửa điểm phần trăm nhưng chi phí chỉ bằng một nửa. Tính chung trên các bài kiểm tra mà cả hai model đều có số liệu, Opus 5 thắng nhiều hơn thua và phần thắng thường lớn hơn phần thua. Cách kiểm chứng nhanh nhất: chạy cùng một tác vụ trên cả hai model ở effort tương đương, rồi so sánh chất lượng đầu ra thay vì chỉ nhìn benchmark được công bố. Không bị ép giữ dữ liệu 30 ngày Fable 5 và Mythos 5 thuộc nhóm Covered Models, bắt buộc lưu giữ prompt và kết quả trong 30 ngày để phục vụ công tác an toàn, đồng thời không hỗ trợ zero data retention (ZDR) trên bất kỳ nền tảng nào, kể cả khi tổ chức đã có thỏa thuận ZDR từ trước. Ngược lại, Opus 5 vẫn vận hành được dưới ZDR như Opus 4.8. Với các đội ngũ xử lý dữ liệu pháp lý, y tế hoặc tài chính, riêng điểm này đã đủ để loại Fable 5 khỏi danh sách lựa chọn mà không cần so hiệu năng. Ít bị gián đoạn bởi bộ lọc an toàn Anthropic cho biết bộ phân loại an ninh mạng của Opus 5 can thiệp ít hơn khoảng 85% so với Fable 5. Với các coding agent chạy nhiều giờ hoặc qua đêm, việc bị chặn giữa chừng vì request chạm ngưỡng an toàn là rủi ro thực sự làm gián đoạn quy trình, và Opus 5 giảm đáng kể tần suất đó. Effort điều chỉnh được, ngân sách dễ đoán hơn Opus 5 hỗ trợ adaptive thinking với effort từ thấp đến tối đa. Mức thấp hoặc trung bình phù hợp cho phản hồi nhanh và khối lượng lớn, còn mức cao hoặc tối đa dành cho coding phức tạp, nghiên cứu sâu và quy trình nhiều bước. Vì phải trả tiền theo effort đã chọn thay vì bị khóa vào một mức giá cố định như Fable 5, đội ngũ có thể tối ưu ngân sách theo từng loại tác vụ thay vì trả giá cao nhất cho mọi request. Cảm nhận ban đầu sau khi dùng thử Opus 5 Sau khi dùng thử Opus 5 cho công việc viết lách và xử lý code hằng ngày, cảm nhận rõ nhất là model này thông minh hơn hẳn Opus 4.8, đặc biệt ở khả năng hiểu ý đồ ngay từ lần yêu cầu đầu tiên mà không cần giải thích lại nhiều lần. Với các tác vụ như tóm tắt tài liệu dài, viết code có logic rẽ nhánh phức tạp hoặc lên kế hoạch nhiều bước, Opus 5 xử lý mượt và ít khi đi lạc đề như bản cũ thường gặp. So với Fable 5 thì vẫn có khoảng cách, dù không lớn như tưởng tượng. Ở những tác vụ đòi hỏi suy luận sâu hoặc phải tự chủ qua nhiều bước liên tiếp mà không có ai can thiệp, Fable 5 vẫn xử lý chắc tay và ít sai sót hơn một chút. Nhưng với phần lớn công việc hằng ngày, mức chênh lệch đó khó nhận ra nếu không đặt hai model cạnh nhau để so sánh trực tiếp. Nếu bạn đang dùng Opus 4.8, đây là thời điểm hợp lý để nâng cấp. Còn nếu đang cân nhắc giữa Opus 5 và Fable 5 cho công việc thông thường, Opus 5 gần như đủ dùng mà không cần trả thêm tiền. Khi nào Fable 5 vẫn là lựa chọn đúng? Fable 5 vẫn giữ được lợi thế ở đúng những chỗ khó nhất. Trên SWE-bench Pro, bộ kiểm tra dùng vấn đề GitHub có thật và được xem là thước đo khắt khe nhất cho công việc coding thực tế, Fable 5 đạt khoảng 80% trong khi Opus 5 đạt khoảng 79%, một khoảng cách nhỏ nhưng vẫn nghiêng về Fable 5. Fable 5 cũng là model duy nhất Anthropic định vị ở cấp Mythos, tức năng lực tổng thể cao hơn Opus theo thiết kế, và điều này thể hiện rõ ở các lĩnh vực chuyên sâu như phân tích y tế chuyên môn hoặc nghiên cứu tự chủ kéo dài nhiều ngày mà không có người giám sát. Nói cách khác, phần thắng của Opus 5 tập trung ở công việc coding và xử lý tri thức hằng ngày, còn lợi thế của Fable 5 nằm ở những bài toán khó nhất và các lĩnh vực đòi hỏi độ tin cậy tuyệt đối. Với đa số người dùng và đội ngũ nhỏ, những bài toán đó chiếm tỷ trọng rất nhỏ trong công việc thường ngày, nên khoản chênh lệch giá gấp đôi khó biện minh được, trừ khi công việc của bạn rơi đúng vào nhóm này. So sánh nhanh Opus 5 và Fable 5 Tiêu chíClaude Opus 5Claude Fable 5 Giá đầu vào5 USD/triệu token10 USD/triệu token Giá đầu ra25 USD/triệu token50 USD/triệu token Context1 triệu token1 triệu token Đầu ra tối đa128.000 token128.000 token Frontier-Bench v0.1 (coding agent)43,3%33,7% SWE-bench Pro (coding thực tế)~79%~80% Lưu giữ dữ liệuHỗ trợ zero data retentionBắt buộc lưu giữ 30 ngày, không có ZDR Tần suất chặn bởi bộ lọc an toànThấp hơn khoảng 85%Cao hơn Phù hợp nhấtCông việc hằng ngày, coding agent, dữ liệu nhạy cảmNghiên cứu khó, dự án tự chủ dài ngày, phân tích y tế chuyên sâu Vậy Opus 5 có thật sự đọ được với GPT-5.6? Trên giấy tờ, câu trả lời là có, nhưng không phải toàn diện. Opus 5 dẫn trước GPT-5.6 Sol ở khả năng suy luận với tình huống mới, thao tác máy tính và phần lớn bài kiểm tra coding công khai, trong khi GPT-5.6 Sol vẫn nhỉnh hơn ở một số bài kiểm tra thao tác dòng lệnh và tìm kiếm thông tin. Không bên nào thắng tuyệt đối, nhưng lần đầu tiên một model tầm giá trung của Anthropic đứng ngang hàng, thậm chí nhỉnh hơn ở nhiều mặt so với model đầu bảng của OpenAI. Câu hỏi đáng quan tâm hơn không phải model nào mạnh hơn mà là model nào thực sự phù hợp với bạn. Nếu công việc hằng ngày xoay quanh code, tài liệu dài và tác vụ nhiều bước, Opus 5 đang là lựa chọn hợp lý cả về giá lẫn chất lượng. Còn nếu bạn đã quen với hệ sinh thái OpenAI hoặc cần đúng thế mạnh của GPT-5.6, chi phí chuyển đổi có thể không đáng để thay đổi. Cách trả lời chắc chắn nhất vẫn là tự chạy thử cùng một việc trên cả hai, vì bảng benchmark không phải lúc nào cũng phản ánh đúng trải nghiệm thật.

Nam
25 thg 7, 2026
So sánh Hermes Agent, OpenClaw và Claude Cowork

Hermes Agent, OpenClaw và Claude Cowork đều được gọi là AI agent vì chúng không chỉ trả lời câu hỏi. Chúng có thể chia mục tiêu thành nhiều bước, gọi công cụ, đọc dữ liệu và tạo ra kết quả hoàn chỉnh. Tuy nhiên, đặt ba sản phẩm cạnh nhau chỉ bằng một bảng tính năng rất dễ dẫn tới lựa chọn sai. Hermes Agent hướng tới một agent có thể học thêm cách làm việc. OpenClaw hướng tới một trợ lý cá nhân luôn sẵn sàng qua các kênh nhắn tin còn Claude Cowork hướng tới người dùng muốn giao việc văn phòng bằng ngôn ngữ tự nhiên trong một môi trường được Anthropic quản lý. Vì vậy, câu hỏi quan trọng không phải công cụ nào mạnh nhất, mà là bạn muốn tự quản bao nhiêu và muốn agent xuất hiện ở đâu trong quy trình hằng ngày. Ba sản phẩm với thiết kế khác nhau Sự khác biệt của 3 công cụ AI Agent không chỉ nằm ở model thực thi mà còn ở bộ khung bao quanh model để quản lý công cụ, bộ nhớ, quyền truy cập và vòng lặp thực thi. Khái niệm này được giải thích chi tiết trong bài Agent Harness là gì?, qua đó người đọc có thể hiểu vì sao cùng được gọi là AI agent nhưng ba sản phẩm lại hành xử rất khác nhau. Hermes Agent ưu tiên vòng lặp học và môi trường thực thi Điểm đáng chú ý của Hermes là skills không chỉ là danh sách các skills đã được cài sẵn. Khi hoàn thành một công việc, agent có thể rút ra quy trình hữu ích, lưu lại và cải thiện ở lần sau. Bài Hermes Agent là gì? giải thích riêng cơ chế tự học này. Giá trị của cơ chế tích lũy tăng dần theo thời gian nếu người dùng có nhiều nhiệm vụ lặp lại như phân tích dự án, theo dõi nguồn tin, chuẩn hóa báo cáo hoặc vận hành một chuỗi công cụ nội bộ. Hermes cũng hỗ trợ nhiều kiểu sandbox như chạy cục bộ, Docker, SSH, Singularity hoặc Modal. Sandbox là môi trường cô lập nơi agent thực thi lệnh và thao tác tệp. Sự linh hoạt này giúp người dùng chọn giữa tốc độ, khả năng kiểm soát và mức độ cách ly, nhưng đồng thời đòi hỏi hiểu biết về hạ tầng, quyền truy cập và cách xử lý khóa bí mật. OpenClaw lấy Gateway làm trung tâm điều phối Trong OpenClaw, Gateway là lớp điều khiển đứng giữa agent, thiết bị và các kênh giao tiếp. Một tin nhắn có thể trở thành yêu cầu để agent đọc lịch, xử lý tệp, gọi dịch vụ hoặc phản hồi về đúng cuộc trò chuyện. Cách tiếp cận này rất tự nhiên với người muốn nhắn cho trợ lý từ điện thoại mà không cần nhớ máy chủ đang chạy ở đâu. OpenClaw phù hợp nhất khi agent cần phản ứng ngay khi có việc cần đến, không cần người dùng mở máy tính hay vào một ứng dụng riêng. Thay vì chờ bạn khởi động một phiên làm việc, nó ngồi sẵn trong các kênh nhắn tin bạn đang dùng và bắt đầu xử lý ngay khi có tin nhắn hoặc sự kiện kích hoạt sẵn. Claude Cowork cung cấp không gian làm việc được quản lý Cowork giảm phần việc hạ tầng mà người dùng phải tự lo. Trong ứng dụng desktop, người dùng có thể cấp quyền cho thư mục cục bộ rồi yêu cầu Claude đọc, sắp xếp hoặc tạo tệp. Với phiên làm việc từ xa, công việc diễn ra trong môi trường cô lập trên máy chủ của Anthropic, phù hợp với những tác vụ dài không cần giữ máy cá nhân hoạt động liên tục. Đổi lại, phạm vi tùy biến và quyền kiểm soát tầng thực thi không rộng như một dự án tự host. Cowork phù hợp hơn với người muốn kết quả nhanh trong hệ sinh thái Claude, không muốn duy trì máy chủ hoặc tự thiết kế một Gateway. Bộ nhớ của ba công cụ hoạt động khác nhau như thế nào Bộ nhớ trong agent không nên được hiểu đơn giản là lưu toàn bộ hội thoại. Một hệ thống hữu ích phải biết thông tin nào đáng giữ, thông tin nào chỉ có giá trị trong phiên hiện tại và khi nào cần lấy lại dữ liệu cũ. Nếu lưu quá ít, agent sẽ phải hỏi những câu hỏi lặp lại còn nếu lưu quá nhiều, chi phí chắc chắn sẽ tăng và dữ liệu nhạy cảm rất dễ bị dùng sai chỗ. Hermes lại nổi bật nhờ kết hợp bộ nhớ bền vững với skill có thể cải thiện. Bộ nhớ giúp ghi nhận sở thích và bối cảnh, còn skill ghi lại cách hoàn thành một loại nhiệm vụ. Hai lớp này tạo ra cảm giác agent ngày càng hiểu người dùng, nhưng chất lượng vẫn phụ thuộc vào việc người dùng xem lại những gì được lưu và loại bỏ quy trình không phù hợp. OpenClaw chạy trên nhiều kênh cùng lúc và đó lại chính là điểm phức tạp nhất của nó. Nhớ nội dung hội thoại chỉ là một phần, vấn đề khó hơn là phân biệt được ai đang nói chuyện ở kênh nào và việc đó thuộc phạm vi nào. Một lệnh gửi trong nhóm Slack của công ty không nên tự động kéo theo ngữ cảnh riêng tư bạn từng trao đổi qua Telegram. Nếu cấu hình phiên và chính sách định danh nên được thiết lập rõ ràng ngay từ đầu, chất lượng model tốt đến đâu cũng không cứu được nếu mọi thứ mù mờ. Cowork giới hạn ngữ cảnh trong từng phiên làm việc, chỉ đọc những tệp bạn cấp quyền và kết nối nào bạn cho phép. Với người không quen dựng hệ thống, cách này dễ kiểm soát hơn vì ranh giới của mỗi tác vụ khá rõ ràng nhưng rõ ràng không có nghĩa là tự động hiểu, bạn vẫn cần nói rõ mình muốn gì, hoàn thành trông như thế nào và dữ liệu lấy từ đâu. Cowork không tự suy ra bối cảnh công ty của bạn nếu bạn không chủ động đưa vào. Mỗi công cụ tự động hóa tốt nhất loại việc nào Hermes có công cụ web, terminal, MCP, lịch chạy tự động và subagent. MCP là chuẩn kết nối giúp agent giao tiếp với nguồn dữ liệu hoặc ứng dụng bên ngoài qua một giao diện thống nhất. Khi kết hợp MCP với skill, người dùng có thể biến một thử nghiệm thành quy trình lặp lại, chẳng hạn mỗi sáng thu thập dữ liệu, phân tích thay đổi và gửi bản tóm tắt. OpenClaw mạnh ở các workflow bắt đầu từ tin nhắn hoặc sự kiện. Ví dụ, người dùng gửi hóa đơn vào kênh riêng, agent trích xuất thông tin rồi cập nhật hệ thống lưu trữ. Một ví dụ khác là nhận cảnh báo dịch vụ, hỏi thêm dữ liệu chẩn đoán và trả về bản tóm tắt ngay trong nhóm vận hành. Giá trị nằm ở việc giảm khoảng cách giữa lúc phát sinh nhu cầu và lúc agent bắt đầu hành động. Cowork phù hợp với đầu ra văn phòng có cấu trúc. Nó có thể nghiên cứu một chủ đề, tổng hợp dữ liệu, tạo tài liệu và tiếp tục chỉnh sửa theo phản hồi. Các tác vụ dài hoặc được lên lịch giúp Cowork vượt khỏi kiểu hỏi đáp ngắn. Tuy vậy, doanh nghiệp cần kiểm tra kỹ từng connector và quyền truy cập trước khi để agent thao tác trên kho dữ liệu thật. Nếu cần tích hợp sâu với hạ tầng riêng, Hermes và OpenClaw thường cho nhiều không gian hơn. Nếu ưu tiên thời gian đi từ yêu cầu tới tài liệu hoàn chỉnh, Cowork thường có lợi thế. Đây là khác biệt giữa nền tảng để lắp ghép và sản phẩm đã đóng gói. Bảo mật của ba AI agent này như thế nào Câu hỏi dùng cái nào an toàn hơn không có câu trả lời đơn giản, vì rủi ro bảo mật của từng công cụ đến từ những điểm hoàn toàn khác nhau. Hermes Agent: Tự host không đồng nghĩa là tự động an toàn. Rủi ro lớn nhất đến từ các skill tự sinh ra vì về bản chất đây là đoạn mã được agent tự viết rồi tự chạy. Nếu không xem lại trước khi cho chạy định kỳ, một skill có quyền terminal hoặc quyền gửi dữ liệu ra ngoài có thể làm những việc bạn không hề hay biết. Ngoài ra, khóa API và thư mục nhạy cảm không nên xuất hiện trong prompt hay được gắn trực tiếp vào sandbox nếu skill đó không thực sự cần đến. OpenClaw: Kết nối càng nhiều kênh thì bề mặt tấn công càng rộng. Điểm dễ bị bỏ qua nhất là xác thực người gửi, vì nếu Gateway chỉ tin vào tên hiển thị hoặc một kênh chưa được bảo vệ đúng cách, một tài khoản nhắn tin bị chiếm quyền là đủ để ai đó ra lệnh cho agent của bạn. Danh sách người được phép gửi lệnh và quyền của từng bot cần được xem xét lại mỗi khi bạn thêm một kênh mới. Claude Cowork: Rủi ro đáng lo nhất là prompt injection, tức khi agent đọc một tài liệu hoặc trang web có chứa chỉ dẫn ẩn nhằm khiến nó làm lệch yêu cầu ban đầu của bạn. Anthropic có cơ chế bảo vệ và yêu cầu xác nhận cho các hành động nhạy cảm, nhưng điều đó không thay thế được việc bạn tự kiểm tra kết quả và không cấp quyền rộng hơn mức công việc thực sự cần. Lưu ý: Với bất kỳ agent nào, đừng cấp quyền xóa tệp hay gửi tin nhắn ra ngoài hay thực hiện giao dịch nhạy cảm. Vậy hãy bắt đầu với chế độ chỉ đọc, bật ghi nhật ký đầy đủ và giữ quyền phê duyệt cho những hành động cần đến con người. Nên chọn Hermes Agent, OpenClaw hay Claude Cowork? Mội công cụ có một điểm mạnh điểm yếu riêng vì vậy muốn chọn được công cụ phù hợp nhất còn tùy thuộc vào người sử dụng và công việc cần sử dụng. Chọn Hermes Agent khi muốn agent ngày càng hiểu cách bạn làm việc Hermes phù hợp với nhà phát triển, người nghiên cứu hoặc nhóm kỹ thuật muốn agent học quy trình riêng và chạy trên hạ tầng linh hoạt. Nó đặc biệt đáng cân nhắc khi nhiệm vụ lặp lại đủ nhiều để skill tạo ra lợi ích tích lũy. Bạn cần sẵn sàng đọc log, kiểm tra skill và quản lý môi trường thực thi. Phù hợp nhất khi: Bạn muốn agent nhớ và cải thiện quy trình làm việc qua từng lần dùng. Bạn có thể tự quản lý sandbox, chọn model và kiểm soát quyền truy cập. Chọn OpenClaw khi công việc cần giao tiếp liên tục từ tin nhắn OpenClaw phù hợp khi trợ lý cần có mặt trên Telegram, WhatsApp, Slack, Zalo hoặc các kênh tương tự. Nó hữu ích cho cảnh báo, thu thập yêu cầu nhanh và tự động hóa có điểm bắt đầu từ hội thoại. Đổi lại, bạn phải quản lý danh tính, quyền kênh và độ ổn định của Gateway. Phù hợp nhất khi: Yêu cầu thường đến dưới dạng tin nhắn hoặc cảnh báo tự động. Bạn cần một điểm điều phối duy nhất cho nhiều kênh giao tiếp khác nhau. Chọn Claude Cowork khi cần kết quả nhanh mà không muốn dựng hệ thống Cowork phù hợp với người làm nội dung, phân tích hoặc quản lý cần tài liệu, bảng tính và slide hoàn chỉnh mà không muốn nghĩ đến server hay Gateway. Bù lại, bạn nên hiểu rõ giới hạn của gói đang dùng, dữ liệu đi qua đâu, kết nối nào đang được bật trước khi đưa công việc thật vào. Phù hợp nhất khi: Bạn muốn mô tả kết quả cần đạt bằng ngôn ngữ tự nhiên và nhận lại đầu ra hoàn chỉnh. Bạn ưu tiên sự tiện lợi của một dịch vụ được quản lý hơn là toàn quyền kiểm soát hạ tầng.

Nam
14 thg 7, 2026
GPT-5.6 có gì mới so với Claude Fable 5?

Ba cái tên Sol, Terra và Luna khiến GPT-5.6 trông giống một hệ sản phẩm hơn là một model đơn lẻ. Cách đặt tên này cũng cho thấy điều OpenAI muốn thay đổi: người dùng không còn phải chọn giữa một model mạnh nhưng đắt và một model nhỏ nhưng yếu, thay vào đó họ có ba mức năng lực được thiết kế cho ba kiểu công việc khác nhau. Tuy nhiên, GPT-5.6 hiện mới ở giai đoạn preview giới hạn và OpenAI nói rõ rằng dòng model này chưa có trong ChatGPT trong thời gian preview.Ở phía đối diện, Claude Fable 5 được Anthropic định vị là model mạnh cho reasoning, lập trình, nghiên cứu khoa học và các tác vụ agentic kéo dài. Vì vậy, câu hỏi đáng quan tâm không chỉ là model nào thông minh hơn, mà là kiến trúc sản phẩm nào giúp người dùng hoàn thành công việc tốt hơn với chi phí có thể kiểm soát.GPT-5.6 thực sự là gì?Theo thông báo preview của OpenAI, GPT-5.6 gồm ba phiên bản Sol, Terra và Luna. Sol là model chủ lực có năng lực cao nhất, Terra là lựa chọn mạnh với chi phí thấp hơn, còn Luna là model nhanh và tiết kiệm nhất trong dòng sản phẩm.Điểm quan trọng nằm ở cách OpenAI chia nhu cầu thành ba tầng. Một nhóm nghiên cứu có thể dùng Sol để xử lý bài toán khó, một đội sản phẩm có thể dùng Terra cho phần lớn công việc hằng ngày, trong khi một hệ thống xử lý hàng nghìn yêu cầu ngắn có thể dùng Luna để giảm độ trễ. Cách tổ chức này gần với chiến lược hạ tầng hơn là cách ra mắt một chatbot mới.Lưu ý về phạm vi phát hành: OpenAI cho biết GPT-5.6 chưa có trong ChatGPT trong giai đoạn preview. Trải nghiệm trên API, công cụ dành cho developer hoặc nền tảng đối tác không nên được hiểu là trải nghiệm ChatGPT chính thức.Sol dành cho công việc khó và dàiSol được định vị là model mạnh nhất của GPT-5.6, phù hợp với nhiệm vụ cần reasoning sâu, lập trình nhiều bước và kiểm tra chéo kết quả. Ví dụ, một đội kỹ thuật có thể giao cho Sol việc đọc cấu trúc repository, tìm nguyên nhân lỗi, đề xuất bản vá và viết kiểm thử hồi quy. Giá trị của Sol không nằm ở việc trả lời nhanh một câu hỏi ngắn, mà ở khả năng giữ mục tiêu xuyên suốt một chuỗi hành động dài.OpenAI cũng nhấn mạnh mức cải thiện về năng lực cyber khi reasoning tăng. Điều này có ích cho kiểm tra bảo mật và phân tích lỗ hổng trong môi trường được cấp phép, nhưng đồng thời khiến việc kiểm soát quyền truy cập, ghi log và phê duyệt hành động trở nên quan trọng hơn.Terra là lựa chọn cân bằngTerra hướng đến phần việc rộng nhất: phân tích tài liệu, viết nội dung, lập trình ứng dụng, tổng hợp nghiên cứu và hỗ trợ vận hành. Nếu Sol giống một chuyên gia được gọi vào khi bài toán thật sự khó, Terra giống một thành viên mạnh có thể làm việc liên tục trong ngày mà không khiến chi phí tăng quá nhanh.Ví dụ, một nhóm marketing có thể dùng Terra để đọc báo cáo thị trường, trích xuất insight, xây dựng dàn ý và tạo nhiều phiên bản nội dung. Một đội phát triển có thể dùng Terra cho code review, viết test và xử lý ticket có phạm vi rõ ràng. Đây là tầng model có khả năng trở thành lựa chọn mặc định nếu chất lượng thực tế ổn định.Luna ưu tiên tốc độ và quy môLuna được thiết kế cho phản hồi nhanh và chi phí thấp. Các tác vụ như phân loại yêu cầu, tóm tắt đoạn hội thoại, trích xuất trường dữ liệu, tạo bản nháp hoặc định tuyến ticket thường không cần model mạnh nhất. Trong những trường hợp đó, độ trễ và tổng chi phí quan trọng hơn khả năng reasoning cực đại.Tuy nhiên, nhanh không đồng nghĩa với phù hợp cho mọi việc. Nếu nhiệm vụ yêu cầu kiểm chứng nguồn, lập kế hoạch nhiều bước hoặc chỉnh sửa code có ảnh hưởng lớn, người dùng nên chuyển sang Terra hoặc Sol thay vì cố ép Luna xử lý vượt quá vai trò của nó.Claude Fable 5 chọn một hướng khácAnthropic giới thiệu Claude Fable 5 như một model frontier dành cho reasoning, software engineering, vision, nghiên cứu khoa học và công việc agentic dài. Thay vì nhấn mạnh ba tầng sản phẩm trong cùng một thế hệ, Anthropic tập trung thông điệp vào năng lực của một model mạnh có thể xử lý các nhiệm vụ phức tạp trong hệ sinh thái Claude.Sự khác biệt này ảnh hưởng trực tiếp đến cách doanh nghiệp triển khai. Với GPT-5.6, đội kỹ thuật có thể xây bộ định tuyến để gửi từng yêu cầu đến Sol, Terra hoặc Luna. Với Fable 5, trọng tâm có thể nằm ở việc tối ưu prompt, công cụ và ngân sách reasoning cho một model chủ lực. Không có cách nào luôn tốt hơn, bởi quyết định phụ thuộc vào loại workload và khả năng vận hành của từng tổ chức.Cách so sánh thực tế: Đừng dùng một prompt duy nhất rồi kết luận. Hãy tạo bộ test gồm tác vụ ngắn, tác vụ reasoning dài, coding, trích xuất dữ liệu và xử lý lỗi. Sau đó đo độ chính xác, thời gian phản hồi, số lần phải sửa và chi phí hoàn thành.Khác biệt trong coding và agentic workCả GPT-5.6 Sol và Claude Fable 5 đều hướng đến công việc lập trình phức tạp, nhưng trải nghiệm thực tế phụ thuộc nhiều vào công cụ bao quanh model. Khả năng đọc repository, chạy lệnh, quan sát kết quả và tự sửa sai thường quan trọng ngang với điểm benchmark. Nếu bạn làm việc với workflow OpenAI, trang Codex là điểm bắt đầu phù hợp để hiểu cách model tham gia vào quy trình coding.Fable 5 có lợi thế khi người dùng đã quen với hệ sinh thái Claude và các quy trình agentic dài. Bạn có thể đọc thêm bài Anthropic ra mắt Claude Fable 5 để xem cách Anthropic định vị model này và những nhóm công việc mà hãng muốn nhắm tới.Trải nghiệm ban đầu từ các diễn đàn nói gì?Các cuộc thảo luận ban đầu trên Reddit và cộng đồng developer tập trung nhiều vào câu hỏi Sol, Terra và Luna khác nhau đến đâu trong công việc thật. Một số người mô tả Sol là lựa chọn phù hợp cho nhiệm vụ nhiều bước, Terra dễ dùng hơn cho công việc thường xuyên, còn Luna gây chú ý nhờ tốc độ. Những nhận xét này phù hợp với cách OpenAI định vị ba model, nhưng chưa đủ để chứng minh khoảng cách chất lượng cụ thể.Phản hồi diễn đàn có giá trị vì nó cho thấy vấn đề người dùng thật đang quan tâm, tuy nhiên đây là dữ liệu tự chọn. Người đăng có thể dùng prompt khác nhau, quyền truy cập khác nhau và môi trường tích hợp khác nhau. Một kết quả tốt trên công cụ dành cho developer không đảm bảo sẽ giống hệt khi model xuất hiện trong ChatGPT.Điểm cộng được nhắc đếnBa tier giúp người dùng hình dung rõ hơn model nào phù hợp với từng loại tác vụ.Luna tạo kỳ vọng về độ trễ thấp cho các quy trình cần xử lý số lượng lớn.Terra có tiềm năng trở thành lựa chọn mặc định nếu giữ được chất lượng ổn định với chi phí dễ chịu.Sol được kỳ vọng mạnh hơn ở coding, reasoning dài và nhiệm vụ cần nhiều vòng kiểm tra.Những câu hỏi vẫn chưa có đáp án đầy đủKhoảng cách chất lượng thực tế giữa Sol và Terra lớn đến đâu trên workload phổ biến.Chi phí toàn phần khi tính cả số lần sửa, retry và thời gian người dùng phải kiểm tra.Hiệu quả của Luna khi prompt dài hoặc yêu cầu có nhiều ràng buộc.Mức độ ổn định khi OpenAI mở rộng GPT-5.6 từ preview sang ChatGPT, Codex và API.Không nên dùng phản hồi diễn đàn như benchmark: Trải nghiệm cộng đồng là tín hiệu để chọn bài test, không phải bằng chứng đủ mạnh để chọn model cho production.So sánh GPT-5.6 và Fable 5 theo công việcViết và phân tích tài liệuTerra có vẻ là lựa chọn hợp lý cho phần lớn công việc tài liệu vì nó được định vị cân bằng giữa năng lực và chi phí. Fable 5 có thể phù hợp khi tài liệu dài, câu hỏi phức tạp và người dùng muốn model duy trì lập luận xuyên suốt. Khi thử nghiệm, nên chấm cả độ chính xác của trích dẫn, khả năng giữ cấu trúc và mức độ chỉnh sửa cần thiết trước khi xuất bản.Lập trình và sửa lỗiSol và Fable 5 đều là ứng viên cho nhiệm vụ coding khó. Một bài test tốt nên bao gồm đọc code hiện có, tìm nguyên nhân, sửa tối thiểu, viết test và giải thích rủi ro. Nếu chỉ yêu cầu tạo một hàm mới từ đầu, kết quả có thể không phản ánh khả năng làm việc trong repository thật.Tác vụ số lượng lớnLuna có lợi thế định vị rõ ràng trong phân khúc tốc độ và chi phí. Với hàng nghìn yêu cầu trích xuất hoặc phân loại mỗi ngày, chênh lệch nhỏ về giá và latency có thể tạo ra tác động lớn. Fable 5 không nhất thiết là lựa chọn kinh tế cho loại workload này nếu tổ chức chỉ cần câu trả lời ngắn và có cấu trúc.Nghiên cứu và reasoning dàiSol và Fable 5 nên được so sánh bằng nhiệm vụ có đáp án kiểm chứng được, thay vì câu hỏi mở dễ tạo cảm giác thuyết phục. Ví dụ, hãy giao cùng một tài liệu nghiên cứu, yêu cầu xác định giả định, tìm mâu thuẫn, đề xuất thí nghiệm và chỉ ra phần nào chưa đủ bằng chứng. Model tốt hơn là model giúp người dùng phát hiện lỗi nhanh hơn, không phải model viết dài hơn.Nên chọn Sol, Terra, Luna hay Fable 5?Nếu ưu tiên chất lượng cao nhất trong hệ sinh thái OpenAI, Sol là lựa chọn đáng thử đầu tiên. Nếu cần một model mạnh để dùng thường xuyên, Terra có vị trí hợp lý hơn. Nếu workload gồm nhiều tác vụ ngắn và lặp lại, Luna có thể giảm chi phí đáng kể. Trong khi đó, Fable 5 phù hợp với đội nhóm đã đầu tư vào hệ sinh thái Claude hoặc cần reasoning và agentic work dài.Do GPT-5.6 vẫn ở giai đoạn preview, lựa chọn an toàn là không chuyển toàn bộ workload ngay lập tức. Hãy chạy thử song song trên dữ liệu thật, che thông tin nhạy cảm, ghi lại lỗi và dùng cùng tiêu chí đánh giá cho mọi model.Bộ kiểm tra có thể áp dụng ngayChọn 20 tác vụ đại diện cho công việc thật, gồm cả trường hợp dễ và khó.Chạy từng tác vụ trên Sol, Terra, Luna và Fable 5 nếu có quyền truy cập.Chấm độ chính xác, thời gian phản hồi, chi phí và số lần cần con người sửa.Ghi lại lỗi nghiêm trọng thay vì chỉ tính điểm trung bình.Chọn model theo từng nhóm tác vụ, không nhất thiết dùng một model cho mọi việc.GPT-5.6 có đáng để chuyển sang ngay không?Điểm mới đáng chú ý nhất của GPT-5.6 không chỉ là năng lực của Sol, mà là cách OpenAI biến một thế hệ model thành ba tầng vận hành rõ ràng. Điều đó có thể giúp doanh nghiệp kiểm soát chi phí tốt hơn, nhưng cũng đòi hỏi họ biết phân loại workload và xây cơ chế chuyển model phù hợp.Hành động thiết thực nhất lúc này là tạo một bộ test nhỏ từ dữ liệu thật của bạn. Nếu Sol thắng ở tác vụ khó, Terra đủ tốt cho phần lớn công việc và Luna xử lý tốt tác vụ số lượng lớn, kiến trúc ba tầng sẽ có giá trị. Nếu Fable 5 cho kết quả ổn định hơn trên reasoning dài, bạn vẫn có lý do để duy trì hệ thống đa model thay vì đặt cược vào một nhà cung cấp.

Liên
9 thg 7, 2026
Anthropic vừa ra mắt model cực kì mạnh mẽ Claude Fable 5

Anthropic đã thả một quả bom đến thế giới với AI với Claude Fable 5 và nó đã trở thành model được bàn tán nhiều nhất tuần này. Không chỉ vì sức mạnh của nó, mà vì cái cách Anthropic đưa nó ra thế giới: đây là lần đầu tiên một model thuộc dòng Mythos class được phép tiếp cận người dùng thông thường, sau hai tháng bị giữ kín vì lý do an toàn. Fable 5 là gì và tại sao nó khác các model trước? Về bản chất, Fable 5 không phải một model xây từ đầu mà là phiên bản "an toàn hóa" của Mythos 5, tức model mạnh nhất Anthropic từng xây dựng. Hồi tháng 4/2026, Mythos Preview chỉ được cấp quyền truy cập cho một nhóm rất nhỏ các tổ chức như AWS, Apple, Google, Cisco và JPMorgan Chase thông qua Project Glasswing, bởi khả năng phát hiện và khai thác lỗ hổng phần mềm của nó quá mạnh để tung ra đại trà. Anthropic cũng đã ra mắt Claude Opus 4.8 trước đó như một bước đệm trong lộ trình phát triển dòng model thế hệ mới này. Để đưa được Mythos ra ngoài, Anthropic mất thêm hai tháng xây dựng các lớp classifier chạy song song. Đây là những AI chuyên biệt phân tích yêu cầu trước khi model chính xử lý, và khi phát hiện câu hỏi thuộc vùng nhạy cảm, hệ thống tự động chuyển sang Claude Opus 4.8 mà không tính thêm phí. Anthropic cho biết cơ chế này chỉ kích hoạt trong chưa đến 5% số phiên làm việc, nghĩa là phần lớn người dùng thông thường sẽ không nhận thấy sự khác biệt nào so với Mythos 5 thuần. Fable 5 và Mythos 5 có cùng mức giá: $10/triệu token đầu vào và $50/triệu token đầu ra, thấp hơn một nửa so với Mythos Preview trước đây. Người dùng gói Pro, Max, Team và Enterprise được dùng miễn phí đến hết ngày 22/6/2026. Từ ngày 23/6, Anthropic chuyển sang tính phí theo lượng dùng cho đến khi hạ tầng đủ mạnh để đưa model trở lại gói cố định. Fable 5 khác Mythos 5 như thế nào ở phần bảo mật? Dù cùng chia sẻ một model nền, Fable 5 và Mythos 5 là hai sản phẩm khác nhau về mặt thiết kế. Sự khác biệt nằm hoàn toàn ở các lớp classifier an toàn được tích hợp bên trên model gốc. Ba lớp classifier mà Fable 5 có, Mythos 5 không có Fable 5 được trang bị ba lớp phân loại an toàn chạy song song với model chính, gồm: an ninh mạng (Cybersecurity), sinh học và hóa học (Biology and Chemistry) và chưng cất (Distillation). Khi người dùng gửi yêu cầu thuộc các vùng này, Fable 5 tự động chuyển sang xử lý bằng Claude Opus 4.8 thay vì model chính, đồng thời thông báo rõ cho người dùng biết. Mythos 5 không có các lớp lọc này. Nó giữ nguyên toàn bộ khả năng khai thác lỗ hổng phần mềm và nghiên cứu sinh học mà Anthropic đánh giá là quá nguy hiểm để phân phối rộng rãi. Đó là lý do Mythos 5 vẫn chỉ dành cho nhóm hạn chế trong Project Glasswing, bao gồm các chuyên gia phòng thủ mạng, tổ chức hạ tầng trọng yếu và nhà nghiên cứu sinh học được cấp quyền. Hiệu suất thực tế bị ảnh hưởng ra sao? Sự khác biệt về classifier dẫn đến kết quả đo lường khác nhau đáng kể trong các tác vụ chuyên biệt. Trên benchmark ExploitBench dành riêng cho an ninh mạng, Mythos 5 đạt 78%, trong khi Fable 5 chỉ đạt gần mức 40% của Opus 4.8, bởi cơ chế fallback kích hoạt ngay khi phát hiện các yêu cầu liên quan đến tấn công mạng. Với nghiên cứu khoa học, Mythos 5 có thể thiết kế protein và tạo giả thuyết mới với tốc độ gấp 10 lần phương pháp trước, trong khi những khả năng này bị giới hạn trong Fable 5 để đảm bảo an toàn. Nếu bạn là nhà nghiên cứu hoặc làm việc trong lĩnh vực an ninh mạng hợp pháp, cần lưu ý rằng Fable 5 có thể tự động chuyển hướng một số yêu cầu sang Opus 4.8, ngay cả khi ngữ cảnh hoàn toàn hợp lệ. Anthropic thừa nhận điều này và đang tiếp tục cải thiện độ chính xác của classifier. Hiệu năng thực tế: con số nói gì? Trên benchmark SWE-Bench Pro dành cho lập trình, Fable 5 đạt 80,3%, so với 69,2% của Opus 4.8 và 58,6% của GPT-5.5. Con số ấn tượng hơn đến từ môi trường thực tế: Stripe dùng Fable 5 để di trú toàn bộ codebase Ruby 50 triệu dòng trong một ngày, trong khi cả nhóm kỹ sư làm thủ công cần hơn hai tháng cho cùng tác vụ đó. Với phân tích kinh doanh, Fable 5 là model đầu tiên vượt mốc 90% trên bộ kiểm tra analytics phức tạp của Hex, cao hơn Opus 4.8 tới 10 điểm phần trăm. IMC, một công ty giao dịch tài chính, cho biết model đạt điểm gần như tuyệt đối trên bộ đánh giá nội bộ bao gồm tra cứu dữ kiện, suy luận nhân quả và tính toán giá trị kỳ vọng. Điểm khác biệt lớn nhất so với các model trước nằm ở khả năng duy trì tập trung trong tác vụ dài nhiều ngày mà không cần con người giám sát từng bước. Thay vì nhận lệnh và chạy từng câu lệnh rời rạc, Fable 5 có thể tiếp nhận một dự án lớn, tự lập kế hoạch, chạy kiểm thử và xử lý lỗi theo vòng lặp, hoạt động gần với cách một kỹ sư làm việc hơn là một công cụ trả lời câu hỏi. Fable 5 hiện có trên Claude API với model ID claude-fable-5, đồng thời hỗ trợ trên Amazon Bedrock và Google Vertex AI dành cho doanh nghiệp theo gói tiêu thụ. Notion tích hợp Fable 5: từ ghi chú rời rạc đến kế hoạch hoàn chỉnh Notion là một trong những ứng dụng đầu tiên tích hợp Fable 5, và lý do khá dễ hiểu. Loại tác vụ mà Fable 5 xử lý tốt nhất, cụ thể là đọc nhiều nguồn dữ liệu rời rạc, tổng hợp và tạo ra cấu trúc có logic, chính xác là những gì người dùng Notion cần nhất trong công việc hằng ngày. Simon Last, đồng sáng lập Notion, mô tả use case chính là biến ghi chú cuộc họp lộn xộn thành bảng công việc có phân công và thứ tự ưu tiên. Thay vì người dùng phải đọc lại toàn bộ biên bản, tóm tắt và tạo task thủ công, Fable 5 thực hiện toàn bộ chuỗi đó mà không cần được nhắc từng bước. Chưa có thông báo gì với Notion về Fable 5 sau ngày 22/6. Sau mốc đó, chi phí chưa biết sẽ tính toán như thế nào với Notion AI nếu rẻ hơn chính chủ Anthropic thì thật là tuyệt vời. Một số điều cần lưu ý trước khi dùng Fable 5 mạnh, nhưng có hai điểm đáng cân nhắc trước khi đưa vào quy trình làm việc thực tế. Thứ nhất, mức giá $50/ 1 triệu token đầu ra là khá cao so với mặt bằng chung, phù hợp với tác vụ kỹ thuật hoặc phân tích phức tạp, nhưng không nhất thiết phải dùng cho các tác vụ đơn giản mà Sonnet hay Haiku xử lý tốt với chi phí thấp hơn nhiều. Thứ hai, lớp classifier bảo vệ hoạt động tốt trong hầu hết trường hợp nhưng cũng có thể kích hoạt nhầm trong một số ngữ cảnh nghiên cứu hợp lệ, điều mà Anthropic thừa nhận và đang tiếp tục cải thiện. Với người dùng cá nhân đang ở gói Pro hoặc Max, những ngày còn lại trước mốc 22/6 là đủ để đánh giá xem Fable 5 có thực sự với giá đó có tạo ra được lợi nhuận không trước khi quyết định có nên trả thêm tiền hay không.

Nam
10 thg 6, 2026