Anthropic tăng giới hạn sử dụng Claude sau hợp tác với SpaceX

Xuất bản vào 8 tháng 05, 2026

Tóm tắt nhanh

Anthropic chính thức nhân đôi giới hạn sử dụng cho người dùng Claude sau khi đạt được thỏa thuận khai thác trung tâm dữ liệu Colossus 1 khổng lồ của SpaceX.

Anthropic vừa công bố hợp tác với SpaceX để tiếp cận hơn 220.000 GPU NVIDIA và ngay lập tức dùng năng lực điện toán mới này để tăng giới hạn sử dụng cho Claude Code lẫn API. Đây là những gì thay đổi và tại sao điều đó quan trọng với người dùng.

Tại sao Anthropic lại hợp tác với SpaceX?

Trong vài tháng gần đây, Anthropic liên tục ký kết các thỏa thuận điện toán quy mô lớn với Amazon, Google, Microsoft và NVIDIA. Lần này, hãng tiếp tục bổ sung thêm một tên tuổi không ai ngờ tới là SpaceX.

Theo thông báo ngày 6/5, Anthropic đã ký thỏa thuận sử dụng toàn bộ năng lực tính toán tại trung tâm dữ liệu Colossus 1 của SpaceX tương đương với hơn 300 megawatt công suất và hơn 220.000 GPU NVIDIA. Toàn bộ năng lực này sẽ được đưa vào sử dụng trong vòng một tháng và sẽ cải thiện trực tiếp trải nghiệm cho người dùng Claude Pro và Claude Max.

Những thay đổi cụ thể về giới hạn sử dụng

Nhờ nguồn điện toán mới, Anthropic đã thực hiện ba thay đổi có hiệu lực ngay từ ngày công bố

Tăng gấp đôi giới hạn Claude Code theo giờ

Giới hạn tốc độ 5 giờ của Claude Code được nhân đôi cho các gói Pro, Max, Team và Enterprise. Nếu trước đây bạn chỉ sử dụng được 10 lệnh chạy Claude Code phức tạp nay được nhân đôi lên thành 20 lần, thay đổi này sẽ giúp ích đáng kể. Tuy nhiên lưu ý là quan trọng là giới hạn tuần (week limit) vẫn giữ nguyên không thay đổi gì cho nên việc tăng giới hạn 5 giờ giúp bạn làm việc cường độ cao hơn trong thời gian ngắn, nhưng có thể khiến bạn chạm mức trần của tuần nhanh hơn.

Bỏ giới hạn giờ cao điểm

Trước đây, Claude Code tự động giảm giới hạn sử dụng trong khung giờ cao điểm (thường từ 9h sáng đến 3h chiều) đối với tài khoản Pro và Max. Giới hạn này đã được xóa bỏ hoàn toàn vì vậy người dùng giờ đây có thể sử dụng Claude Code với tốc độ đầy đủ bất kể thời điểm trong ngày.

Tăng mạnh giới hạn API cho các mô hình Claude Opus

Giới hạn tốc độ API (rate limit) cho các mô hình Claude Opus được nâng lên đáng kể . Chi tiết mức tăng bằng lần được Anthropic công bố trong bảng sau đây:

Thay đổi này đặc biệt quan trọng với các nhà phát triển đang xây dựng ứng dụng trên nền tảng Claude Code

Toàn cảnh chiến lược điện toán của Anthropic

Thỏa thuận với SpaceX không phải động thái đơn lẻ. Trong vài tháng gần đây, Anthropic đã xây dựng một danh mục đầu tư hạ tầng rất đáng chú ý:

Thỏa thuận lên tới 5 gigawatt với Amazon, trong đó gần 1 GW sẽ hoạt động trước cuối 2026
Thỏa thuận 5 GW với Google và Broadcom, dự kiến đưa vào vận hành từ 2027
Quan hệ đối tác chiến lược với Microsoft và NVIDIA, bao gồm 30 tỷ USD năng lực Azure
Đầu tư 50 tỷ USD vào hạ tầng AI tại Mỹ cùng Fluidstack
Và nay, hơn 300 megawatt từ trung tâm Colossus 1 của SpaceX

Anthropic chạy Claude trên nhiều nền tảng phần cứng khác nhau — AWS Trainium, Google TPU và GPU NVIDIA — và cho biết vẫn đang tiếp tục tìm kiếm thêm các nguồn năng lực tính toán mới.

Mở rộng ra thị trường quốc tế

Một phần năng lực điện toán mở rộng sẽ được dùng để phục vụ khách hàng doanh nghiệp quốc tế đặc biệt trong các lĩnh vực yêu cầu lưu trữ dữ liệu nội địa như tài chính, y tế và chính phủ. Thỏa thuận với Amazon bao gồm cả năng lực suy luận bổ sung tại châu Á và châu Âu.

Anthropic cũng nhấn mạnh rằng họ chỉ mở rộng sang các quốc gia có khung pháp lý dân chủ và chuỗi cung ứng phần cứng an toàn cho thấy một lập trường thể hiện sự thận trọng trong bối cảnh cạnh tranh địa chính trị về AI đang ngày càng gay gắt.

Điều này có ý nghĩa gì với người dùng Claude tại Việt Nam?

Ở góc độ thực tế, ba thay đổi về giới hạn sử dụng mang lại lợi ích trực tiếp nhất cho những ai đang dùng Claude Code hàng ngày — đặc biệt là lập trình viên và người làm việc liên tục với Claude Code.Việc xóa giới hạn giờ cao điểm cũng có nghĩa là trải nghiệm của người dùng tại Việt Nam (vốn trùng múi giờ với giai đoạn tải nặng tại Mỹ) sẽ ổn định hơn.

Về dài hạn, năng lực điện toán lớn hơn thường đồng nghĩa với khả năng triển khai các mô hình mạnh hơn, với chi phí thấp hơn. Đây là nền tảng để Anthropic tiếp tục cạnh tranh với OpenAI và Google trong cuộc đua AI 2026.

Anthropic luôn luôn phát triển

Anthropic đang đầu tư nghiêm túc vào hạ tầng và hợp tác với SpaceX là bước đi mới nhất trong chiến lược đó. Kết quả gần nhất mà người dùng có thể cảm nhận ngay là Claude Code ít bị giới hạn hơn và tốc độ API chắc chắn sẽ cải thiện. Còn về lâu dài, cuộc chạy đua điện toán giữa các công ty AI lớn hứa hẹn sẽ còn nhiều diễn biến thú vị trong năm 2026.

Thảo luận (0)

Đăng nhập để tham gia thảo luận.

Chưa có bình luận nào. Hãy là người đầu tiên!

Các bài viết liên quan

Agent Harness là gì? Bộ khung giúp AI làm việc hiệu quả

Hãy tưởng tượng bạn có một trợ lý AI vô cùng thông minh nhưng lại rất nhanh quên và không tự kiểm tra được chất lượng công việc của mình. Để giải quyết vấn đề này, các nhà phát triển đã tạo ra một lớp bảo vệ và quản lý bao quanh mô hình AI mang tên agent harness. Đây chính là thứ giúp các trợ lý AI tự động hoàn thành những nhiệm vụ phức tạp mà không cần sự can thiệp liên tục từ con người. Agent harness là gì? Để dễ hình dung, hãy tưởng tượng mô hình AI giống như một nhân viên mới cực kỳ thông minh nhưng lại có trí nhớ rất ngắn hạn và hoàn toàn xa lạ với môi trường làm việc. Nhân viên này có thể giải quyết các bài toán phức tạp trong tích tắc nhưng lại dễ quên mình đang làm gì hoặc vô tình gửi nhầm tài liệu quan trọng cho khách hàng. Trong tình huống đó, agent harness đóng vai trò như một người quản lý giàu kinh nghiệm ngồi ngay bên cạnh để hướng dẫn và giám sát. Nói đơn giản hơn, agent harness là lớp phần mềm bao bọc bên ngoài mô hình AI, đảm nhận mọi công việc hành chính và hậu cần để AI chỉ cần tập trung vào việc suy nghĩ và đưa ra giải pháp. Lớp này kết nối AI với các công cụ bên ngoài, ghi chép lại toàn bộ lịch sử công việc qua nhiều ngày và kiểm tra chất lượng kết quả trước khi coi là xong. Về mặt thực tế, một agent harness thực hiện các nhiệm vụ sau: Kết nối mô hình AI với các công cụ bên ngoài như tìm kiếm web, hòm thư điện tử hay lịch làm việc Lưu trữ toàn bộ tiến trình công việc để AI không phải bắt đầu lại từ đầu ở phiên làm việc tiếp theo Lọc bớt thông tin dư thừa và chỉ cung cấp những dữ liệu cần thiết nhất cho AI tại mỗi bước Giám sát các hành động của AI nhằm ngăn chặn những sai sót nguy hiểm Ghi lại nhật ký hoạt động chi tiết để con người dễ dàng kiểm tra khi cần Nguồn gốc thuật ngữ: Khái niệm "agent harness" được chuyên gia công nghệ Mitchell Hashimoto chính thức đặt tên vào đầu năm 2026. Trước đó, nhiều nhóm phát triển đã xây dựng các hệ thống tương tự nhưng chưa có tên gọi chung cho lớp hạ tầng này. Vì sao AI hay thất bại khi làm việc dài hơi? Điểm yếu lớn nhất của các mô hình AI hiện nay là chúng hoàn toàn không có ký ức dài hạn. Khi bạn mở một cuộc trò chuyện mới, AI bắt đầu từ con số không và không nhớ bất kỳ thông tin nào từ các cuộc trò chuyện trước. Hãy tưởng tượng bạn thuê một nhân viên mà mỗi buổi sáng thức dậy đều quên sạch mọi thỏa thuận và tiến độ công việc từ hôm qua. Khi Anthropic thử nghiệm cho Claude xây dựng một ứng dụng web phức tạp mà không có harness hỗ trợ, kết quả rất đáng thất vọng. Hai lỗi liên tục xuất hiện: AI cố gắng làm tất cả cùng một lúc, bộ nhớ bị quá tải giữa chừng và bỏ dở dự án. Phiên tiếp theo lại tốn thời gian đoán xem đã làm được đến đâu. AI tự tuyên bố hoàn thành công việc mà không chạy thử xem kết quả có thực sự hoạt động hay không. Ngoài hai lỗi trên, việc thực hiện các dự án dài hạn còn khiến AI gặp thêm các vấn đề sau: Bộ nhớ làm việc bị tắc nghẽn: Hàng loạt thông tin phụ tích tụ theo thời gian khiến AI dần mất tập trung vào mục tiêu ban đầu Sử dụng công cụ sai cách: AI đôi khi tìm kiếm thông tin không tồn tại hoặc điền sai thông tin vào biểu mẫu, và nếu không có gì chặn lại sẽ lặp đi lặp lại cùng một lỗi Mất toàn bộ tiến trình khi gặp sự cố: Bất kỳ lỗi mạng hay sự cố hệ thống nào cũng xóa sạch những gì đang lưu trong bộ nhớ tạm Nghiên cứu của Stanford (2023): Các mô hình AI thường bỏ qua thông tin nằm ở giữa một văn bản dài, kể cả khi văn bản đó không quá dài. Đây là lý do vì sao việc nạp quá nhiều dữ liệu vào AI cùng lúc thường phản tác dụng nếu không có bộ lọc hỗ trợ. Agent harness hoạt động ra sao trong thực tế? Một agent harness hoạt động qua hai giai đoạn riêng biệt để đảm bảo công việc diễn ra liên tục và không bị gián đoạn. Giai đoạn chuẩn bị (chỉ diễn ra một lần) Harness thiết lập toàn bộ môi trường làm việc trước khi AI bắt đầu: lập danh sách các việc cần làm, chuẩn bị nơi lưu trữ dữ liệu và ghi lại điểm xuất phát. Giống như người quản lý lập kế hoạch chi tiết trước khi giao việc cho nhân viên, giai đoạn này chỉ cần thực hiện một lần duy nhất. Giai đoạn thực thi (lặp lại nhiều lần) Mỗi khi AI bắt đầu một phiên làm việc mới, harness tự động tải lại toàn bộ tiến độ đã lưu và chỉ giao đúng phần việc tiếp theo. Khi AI muốn thực hiện một hành động như tìm kiếm thông tin hay gửi thông báo, harness kiểm tra độ an toàn của yêu cầu đó trước khi thực hiện, làm sạch kết quả trả về rồi mới đưa lại cho AI xử lý tiếp. AI không bao giờ tương tác trực tiếp với hệ thống bên ngoài mà không qua lớp kiểm soát này. Bốn bộ phận quan trọng tạo nên một agent harness Để giúp AI hoạt động ổn định trong thời gian dài, một agent harness tiêu chuẩn cần có bốn thành phần cốt lõi: Cổng kết nối công cụ bên ngoài: Cho phép AI tương tác với thế giới thực như đọc tài liệu, tìm kiếm web hay gửi thông báo. Harness đóng vai trò trung gian, kiểm tra mỗi yêu cầu trước khi thực hiện và đảm bảo kết quả trả về sạch sẽ, dễ xử lý. Bộ quản lý ký ức nhiều tầng: Duy trì ba loại bộ nhớ phục vụ nhu cầu khác nhau gồm ký ức tạm thời trong phiên hiện tại, nhật ký công việc đang thực hiện và kho kiến thức tích lũy lâu dài qua nhiều dự án. Bộ lọc thông tin thông minh: Tóm tắt lịch sử hội thoại dài thành các ý chính và chỉ cung cấp đúng phần dữ liệu liên quan đến bước hiện tại thay vì nạp tất cả cùng lúc, giúp AI luôn tập trung vào đúng nhiệm vụ. Bộ kiểm tra an toàn và phê duyệt: Tự động xác nhận kết quả trước khi coi tác vụ là hoàn thành. Với các hành động nhạy cảm như xóa dữ liệu quan trọng hay gửi email hàng loạt, harness dừng lại và yêu cầu con người xác nhận trước khi tiếp tục. Lưu ý về dữ liệu tích lũy: Nếu kho ký ức của AI được lưu trữ hoàn toàn trên nền tảng đóng của bên thứ ba, bạn có nguy cơ mất toàn bộ kiến thức tích lũy khi muốn chuyển sang hệ thống khác. Đây là điều cần cân nhắc kỹ khi chọn giải pháp AI agent cho công việc lâu dài. Harness engineering và bí quyết tạo ra hàng triệu dòng code Harness engineering là cách tiếp cận xem mỗi thất bại của AI là một lỗi hệ thống cần khắc phục triệt để, không phải thứ cần thử lại hay bỏ qua. Theo Mitchell Hashimoto, nếu AI mắc lỗi, hãy thiết kế lại môi trường để về mặt vật lý nó không thể mắc lỗi đó nữa. Trong thực tế, khi OpenAI xây dựng các dự án phần mềm lớn với ba kỹ sư tạo ra 3,5 pull request mỗi người mỗi ngày mà không gõ một dòng code nào, họ đã thiết lập cơ chế kiểm tra tự động sau mỗi hành động của AI. Khi AI chạy sai, hệ thống trả về thông báo lỗi được viết theo cấu trúc đặc biệt để AI hiểu ngay mình cần sửa đổi gì ở bước tiếp theo. Mỗi thông báo lỗi trở thành ngữ cảnh học tập, không chỉ là cảnh báo. Một nghiên cứu tại hội thảo ICML năm 2025 cũng chứng minh rằng cùng một mô hình AI khi được trang bị harness luôn vượt trội so với chính nó khi chạy không có harness, kể cả khi không thay đổi gì về cách huấn luyện hay câu lệnh đầu vào. Điều này khẳng định môi trường xung quanh AI quan trọng không kém bản thân model. Góc nhìn thực tế: Claude Code của Anthropic hiện đã vượt 512.000 dòng lập trình và con số này tiếp tục tăng. Model ngày càng mạnh hơn không làm cho harness trở nên đơn giản hơn mà ngược lại, lớp hạ tầng này phát triển thêm để tận dụng tối đa những khả năng mới. Khi nào bạn thực sự cần đến agent harness? Với những việc đơn giản như tóm tắt một tài liệu hay trả lời câu hỏi cụ thể, dùng AI trực tiếp là đủ. Nhưng ngay khi công việc bắt đầu kéo dài hơn một cuộc trò chuyện, cần nhớ thông tin từ lần trước hoặc phải thực hiện nhiều bước theo thứ tự nhất định, đó là lúc harness trở nên cần thiết. Một điểm đáng để suy nghĩ: ngay cả tính năng tìm kiếm web tích hợp sẵn trong ChatGPT hay Gemini cũng chính là một dạng harness. Khi AI tự động tra cứu thông tin, có một lớp hạ tầng phía sau đang thực hiện lệnh gọi công cụ, xử lý kết quả và đưa thông tin sạch vào ngữ cảnh. Harness vô hình với người dùng nhưng không thể thiếu với hệ thống. Agent harness không phải xu hướng kỹ thuật ngắn hạn mà là giải pháp cho những giới hạn cốt lõi của AI: không có ký ức dài hạn, bộ nhớ làm việc có giới hạn và dễ mắc lỗi khi dùng công cụ bên ngoài. 4aivn cũng bất đầu áp dụng Harness vào trong công việc bên mình điều này không chỉ giúp AI hoàn thành tác vụ mà còn biến AI thành hệ thống có thể học từ thất bại và cải thiện theo thời gian.

Nam•

1 thg 6, 2026

Đọc thêm

Anthropic vừa ra mắt model cực kì mạnh mẽ Claude Fable 5

Anthropic đã thả một quả bom đến thế giới với AI với Claude Fable 5 và nó đã trở thành model được bàn tán nhiều nhất tuần này. Không chỉ vì sức mạnh của nó, mà vì cái cách Anthropic đưa nó ra thế giới: đây là lần đầu tiên một model thuộc dòng Mythos class được phép tiếp cận người dùng thông thường, sau hai tháng bị giữ kín vì lý do an toàn. Fable 5 là gì và tại sao nó khác các model trước? Về bản chất, Fable 5 không phải một model xây từ đầu mà là phiên bản "an toàn hóa" của Mythos 5, tức model mạnh nhất Anthropic từng xây dựng. Hồi tháng 4/2026, Mythos Preview chỉ được cấp quyền truy cập cho một nhóm rất nhỏ các tổ chức như AWS, Apple, Google, Cisco và JPMorgan Chase thông qua Project Glasswing, bởi khả năng phát hiện và khai thác lỗ hổng phần mềm của nó quá mạnh để tung ra đại trà. Anthropic cũng đã ra mắt Claude Opus 4.8 trước đó như một bước đệm trong lộ trình phát triển dòng model thế hệ mới này. Để đưa được Mythos ra ngoài, Anthropic mất thêm hai tháng xây dựng các lớp classifier chạy song song. Đây là những AI chuyên biệt phân tích yêu cầu trước khi model chính xử lý, và khi phát hiện câu hỏi thuộc vùng nhạy cảm, hệ thống tự động chuyển sang Claude Opus 4.8 mà không tính thêm phí. Anthropic cho biết cơ chế này chỉ kích hoạt trong chưa đến 5% số phiên làm việc, nghĩa là phần lớn người dùng thông thường sẽ không nhận thấy sự khác biệt nào so với Mythos 5 thuần. Fable 5 và Mythos 5 có cùng mức giá: $10/triệu token đầu vào và $50/triệu token đầu ra, thấp hơn một nửa so với Mythos Preview trước đây. Người dùng gói Pro, Max, Team và Enterprise được dùng miễn phí đến hết ngày 22/6/2026. Từ ngày 23/6, Anthropic chuyển sang tính phí theo lượng dùng cho đến khi hạ tầng đủ mạnh để đưa model trở lại gói cố định. Fable 5 khác Mythos 5 như thế nào ở phần bảo mật? Dù cùng chia sẻ một model nền, Fable 5 và Mythos 5 là hai sản phẩm khác nhau về mặt thiết kế. Sự khác biệt nằm hoàn toàn ở các lớp classifier an toàn được tích hợp bên trên model gốc. Ba lớp classifier mà Fable 5 có, Mythos 5 không có Fable 5 được trang bị ba lớp phân loại an toàn chạy song song với model chính, gồm: an ninh mạng (Cybersecurity), sinh học và hóa học (Biology and Chemistry) và chưng cất (Distillation). Khi người dùng gửi yêu cầu thuộc các vùng này, Fable 5 tự động chuyển sang xử lý bằng Claude Opus 4.8 thay vì model chính, đồng thời thông báo rõ cho người dùng biết. Mythos 5 không có các lớp lọc này. Nó giữ nguyên toàn bộ khả năng khai thác lỗ hổng phần mềm và nghiên cứu sinh học mà Anthropic đánh giá là quá nguy hiểm để phân phối rộng rãi. Đó là lý do Mythos 5 vẫn chỉ dành cho nhóm hạn chế trong Project Glasswing, bao gồm các chuyên gia phòng thủ mạng, tổ chức hạ tầng trọng yếu và nhà nghiên cứu sinh học được cấp quyền. Hiệu suất thực tế bị ảnh hưởng ra sao? Sự khác biệt về classifier dẫn đến kết quả đo lường khác nhau đáng kể trong các tác vụ chuyên biệt. Trên benchmark ExploitBench dành riêng cho an ninh mạng, Mythos 5 đạt 78%, trong khi Fable 5 chỉ đạt gần mức 40% của Opus 4.8, bởi cơ chế fallback kích hoạt ngay khi phát hiện các yêu cầu liên quan đến tấn công mạng. Với nghiên cứu khoa học, Mythos 5 có thể thiết kế protein và tạo giả thuyết mới với tốc độ gấp 10 lần phương pháp trước, trong khi những khả năng này bị giới hạn trong Fable 5 để đảm bảo an toàn. Nếu bạn là nhà nghiên cứu hoặc làm việc trong lĩnh vực an ninh mạng hợp pháp, cần lưu ý rằng Fable 5 có thể tự động chuyển hướng một số yêu cầu sang Opus 4.8, ngay cả khi ngữ cảnh hoàn toàn hợp lệ. Anthropic thừa nhận điều này và đang tiếp tục cải thiện độ chính xác của classifier. Hiệu năng thực tế: con số nói gì? Trên benchmark SWE-Bench Pro dành cho lập trình, Fable 5 đạt 80,3%, so với 69,2% của Opus 4.8 và 58,6% của GPT-5.5. Con số ấn tượng hơn đến từ môi trường thực tế: Stripe dùng Fable 5 để di trú toàn bộ codebase Ruby 50 triệu dòng trong một ngày, trong khi cả nhóm kỹ sư làm thủ công cần hơn hai tháng cho cùng tác vụ đó. Với phân tích kinh doanh, Fable 5 là model đầu tiên vượt mốc 90% trên bộ kiểm tra analytics phức tạp của Hex, cao hơn Opus 4.8 tới 10 điểm phần trăm. IMC, một công ty giao dịch tài chính, cho biết model đạt điểm gần như tuyệt đối trên bộ đánh giá nội bộ bao gồm tra cứu dữ kiện, suy luận nhân quả và tính toán giá trị kỳ vọng. Điểm khác biệt lớn nhất so với các model trước nằm ở khả năng duy trì tập trung trong tác vụ dài nhiều ngày mà không cần con người giám sát từng bước. Thay vì nhận lệnh và chạy từng câu lệnh rời rạc, Fable 5 có thể tiếp nhận một dự án lớn, tự lập kế hoạch, chạy kiểm thử và xử lý lỗi theo vòng lặp, hoạt động gần với cách một kỹ sư làm việc hơn là một công cụ trả lời câu hỏi. Fable 5 hiện có trên Claude API với model ID claude-fable-5, đồng thời hỗ trợ trên Amazon Bedrock và Google Vertex AI dành cho doanh nghiệp theo gói tiêu thụ. Notion tích hợp Fable 5: từ ghi chú rời rạc đến kế hoạch hoàn chỉnh Notion là một trong những ứng dụng đầu tiên tích hợp Fable 5, và lý do khá dễ hiểu. Loại tác vụ mà Fable 5 xử lý tốt nhất, cụ thể là đọc nhiều nguồn dữ liệu rời rạc, tổng hợp và tạo ra cấu trúc có logic, chính xác là những gì người dùng Notion cần nhất trong công việc hằng ngày. Simon Last, đồng sáng lập Notion, mô tả use case chính là biến ghi chú cuộc họp lộn xộn thành bảng công việc có phân công và thứ tự ưu tiên. Thay vì người dùng phải đọc lại toàn bộ biên bản, tóm tắt và tạo task thủ công, Fable 5 thực hiện toàn bộ chuỗi đó mà không cần được nhắc từng bước. Chưa có thông báo gì với Notion về Fable 5 sau ngày 22/6. Sau mốc đó, chi phí chưa biết sẽ tính toán như thế nào với Notion AI nếu rẻ hơn chính chủ Anthropic thì thật là tuyệt vời. Một số điều cần lưu ý trước khi dùng Fable 5 mạnh, nhưng có hai điểm đáng cân nhắc trước khi đưa vào quy trình làm việc thực tế. Thứ nhất, mức giá $50/ 1 triệu token đầu ra là khá cao so với mặt bằng chung, phù hợp với tác vụ kỹ thuật hoặc phân tích phức tạp, nhưng không nhất thiết phải dùng cho các tác vụ đơn giản mà Sonnet hay Haiku xử lý tốt với chi phí thấp hơn nhiều. Thứ hai, lớp classifier bảo vệ hoạt động tốt trong hầu hết trường hợp nhưng cũng có thể kích hoạt nhầm trong một số ngữ cảnh nghiên cứu hợp lệ, điều mà Anthropic thừa nhận và đang tiếp tục cải thiện. Với người dùng cá nhân đang ở gói Pro hoặc Max, những ngày còn lại trước mốc 22/6 là đủ để đánh giá xem Fable 5 có thực sự với giá đó có tạo ra được lợi nhuận không trước khi quyết định có nên trả thêm tiền hay không.

Nam•

10 thg 6, 2026

Đọc thêm

Claude Code tự điều phối công việc với Dynamic Workflows

Bài đăng của Thariq Shihipar từ team Claude Code đã gây chú ý lớn trong cộng đồng sử dụng AI. Anh ấy tiết lộ Dynamic Workflows, tính năng cho phép Claude tự thiết kế quy trình làm việc thay vì chỉ chờ lệnh, và đây được coi là bản nâng cấp quan trọng nhất kể từ khi Claude Code có skills và subagents. Tính năng này là khái niệm harness làm bản chất để giải thích các yêu cầu kĩ thuật. Ba lỗi chí mạng nào khiến AI agent thất bại ở nhiệm vụ phức tạp Trước khi nói về giải pháp, Thariq chỉ ra một thực tế khó chịu: hầu hết AI agent hiện nay đều gặp vấn đề nghiêm trọng khi xử lý nhiệm vụ phức tạp, đa bước trong một cửa sổ ngữ cảnh duy nhất. Ông phân loại chúng thành ba dạng thất bại cốt lõi mà gần như mọi hệ thống agent đều mắc phải. Khi AI lười biếng bằng cách tự tuyên bố xong dù mới làm nửa việc Đây là hiện tượng Agentic Laziness, khi agent thực hiện một phần công việc rồi tự báo cáo là đã hoàn thành. Ví dụ cụ thể: bạn yêu cầu agent review 50 file code, nhưng nó chỉ xem qua 20 file rồi kết luận rằng mọi thứ ổn. Nguyên nhân nằm ở giới hạn cửa sổ ngữ cảnh, khi lượng thông tin quá lớn, agent có xu hướng đi tắt để hoàn thành nhanh hơn. Agent sẽ tự thiên vị bản thân nó đúng không Agent tự thiên thị nó gọi là Self-Preferential Bias, điều này xảy ra khi bạn yêu cầu agent kiểm tra lại kết quả của chính nó. Giống như nhờ một học sinh tự chấm bài thi, agent có xu hướng nghiêng về phía kết quả mà nó đã tạo ra, dẫn đến xác nhận thiếu phê phán và bỏ qua các lỗi tiềm ẩn. Điều này đặc biệt nguy hiểm trong các nhiệm vụ đòi hỏi độ chính xác cao. Làm sao để agent không mất dần ý định ban đầu qua mỗi bước Hiện tượng trôi mất mục tiêu (Goal Drift) là hiện tượng agent dần quên mục tiêu ban đầu sau nhiều bước xử lý hoặc sau quá trình nén ngữ cảnh (context compaction). Những ràng buộc cụ thể như "không làm X" hoặc các trường hợp quan trọng có thể bị loại bỏ khi bộ nhớ bị tóm tắt lại vì vậy kết quả cuối cùng lệch khỏi yêu cầu gốc mà agent không hề nhận ra. Dynamic Workflows giúp Claude tự viết bộ khung điều phối công việc Giải pháp của Anthropic không phải là làm model thông minh hơn, mà là thay đổi cách Claude tổ chức công việc. Dynamic Workflows biến Claude từ agent viết code thành agent thiết kế quy trình vận hành cho công việc phức tạp. Khái niệm cốt lõi ở đây là tự tổ chức (self-organization): Claude có thể tự phân tích mục tiêu, chọn chế độ làm việc phù hợp và tạo ra quy trình nội bộ trước khi bắt tay vào thực hiện. Harness tùy chỉnh thay vì quy trình cố định Thay vì hoạt động trong một môi trường cố định, Claude viết một bộ khung harness bằng JavaScript được thiết kế riêng cho từng nhiệm vụ. Harness này đóng vai trò như một quản lý dự án: nó chia nhỏ công việc, khởi tạo các sub-agent chuyên biệt cho từng phần, chỉ định công cụ phù hợp, định tuyến công việc đến các model khác nhau và thực hiện xác minh đối kháng (adversarial verification) để đảm bảo chất lượng. Harness hoạt động như thế nào? Để hiểu rõ hơn, hãy hình dung harness như một kịch bản sân khấu mà Claude tự soạn trước khi diễn. Khi nhận được một nhiệm vụ phức tạp, Claude không lao vào làm ngay mà dừng lại để viết một đoạn JavaScript mô tả toàn bộ quy trình: cần bao nhiêu sub-agent, mỗi agent làm gì, thứ tự thực hiện ra sao và kết quả từ agent này được chuyển cho agent kia như thế nào. Ví dụ cụ thể: nếu bạn yêu cầu Claude audit 1.000 tin nhắn Slack để tìm sự cố lặp lại, harness có thể trông như thế này về mặt logic: Agent 1 (phân loại): đọc toàn bộ tin nhắn và gán nhãn theo chủ đề Agent 2, 3, 4 (xử lý song song): mỗi agent phân tích sâu một nhóm chủ đề riêng Agent 5 (tổng hợp): gom kết quả từ ba agent trên, loại bỏ trùng lặp Agent 6 (kiểm tra chéo): đọc lại kết quả tổng hợp và phản biện độc lập Điểm quan trọng là Claude viết harness này dựa trên đặc điểm cụ thể của từng nhiệm vụ, không phải theo một khuôn mẫu cứng nhắc. Nhiệm vụ khác nhau sẽ cho ra harness khác nhau, và đó chính là lý do tính năng này được gọi là "dynamic". Harness được viết bằng JavaScript và chạy trong môi trường Claude Code. Bạn có thể kích hoạt Dynamic Workflows bằng cách nói “use a workflow” tuy nhiên từ này rất dễ bị nhầm với workflow thông thường vì vậy mọi người nên dùng từ khóa "ultracode" trong câu lệnh thì sẽ phân rõ workflow thông thường và Dynamic Workflow để tiết kiệm token hơn. Cô lập ngữ cảnh để ngăn sự suy thoái của ngữ cảnh Một trong những thiết kế thông minh nhất của Dynamic Workflows là tính năng Isolation. Mỗi sub-agent được cấp cửa sổ ngữ cảnh riêng biệt, hoàn toàn độc lập với các agent khác. Điều này ngăn chặn hiện tượng suy thoái ngữ cảnh (context rot) tức sự suy giảm chất lượng khi ngữ cảnh bị quá tải, đồng thời triệt tiêu cả Agentic Laziness lẫn Goal Drift vì mỗi agent chỉ tập trung vào phần việc nhỏ được giao. Sáu mẫu điều phối có thể tái sử dụng Claude có thể kết hợp sáu mẫu điều phối sẵn có để xử lý đa dạng tình huống: Phân loại và hành động: phân loại đầu vào rồi chọn hành động phù hợp Phân chi và tổng hợp: chia công việc ra nhiều nhánh song song rồi tổng hợp kết quả Kiểm tra chéo: dùng agent khác kiểm tra chéo kết quả Tạo và lọc: tạo nhiều phương án rồi lọc ra phương án tốt nhất Tạo ra giải đấu: cho các phương án "đấu đối khảng trực tiếp với nhau rồi loại dần Vòng lặp: lặp lại cho đến khi đạt tiêu chuẩn chất lượng Có thể tối ưu chi phí khi sử dụng Dynamic Workflows không Chạy nhiều sub-agent song song nghe có vẻ tốn kém, nhưng thực tế Dynamic Workflows được thiết kế để tối ưu chi phí theo một số cách cụ thể. Định tuyến thông minh đến model phù hợp Không phải mọi bước trong quy trình đều cần model mạnh nhất. Harness cho phép Claude định tuyến từng tác vụ đến model phù hợp với độ phức tạp của nó: các bước phân loại đơn giản có thể chạy trên model nhỏ hơn và rẻ hơn, trong khi chỉ những bước đòi hỏi suy luận sâu mới cần đến model lớn. Kết quả là tổng chi phí thường thấp hơn so với việc chạy toàn bộ quy trình trên một model duy nhất. Cô lập ngữ cảnh giúp giảm token tiêu thụ Vì mỗi sub-agent chỉ nhận đúng phần ngữ cảnh cần thiết cho công việc của mình, tổng lượng token tiêu thụ trên toàn bộ quy trình thường thấp hơn đáng kể so với cách tiếp cận truyền thống, khi toàn bộ lịch sử hội thoại được nhồi vào một cửa sổ ngữ cảnh duy nhất ngày càng phình to. Tránh làm lại công việc nhờ kiểm tra lại sớm Harness có thể cài các điểm kiểm tra chất lượng (checkpoint) giữa các bước. Nếu một bước cho ra kết quả không đạt yêu cầu, hệ thống dừng và xử lý lại đúng bước đó thay vì chạy tiếp toàn bộ quy trình rồi mới phát hiện lỗi ở cuối. Cách này tiết kiệm đáng kể chi phí cho các tác vụ dài nhiều bước. Nếu bạn lo ngại về chi phí, hãy bắt đầu với các tác vụ có khối lượng vừa phải để quan sát mức tiêu thụ token thực tế trước khi mở rộng quy mô. Ứng dụng thực tế của Dynamic Workflow như thế nào Điều khiến Thariq hào hứng nhất không phải là khả năng code, mà là việc Dynamic Workflows mở rộng Claude Code sang các nhiệm vụ phi kỹ thuật. Tính năng này có thể kích hoạt bằng ngôn ngữ tự nhiên (ví dụ: "use a workflow") hoặc từ khóa "ultracode." Các ứng dụng thực tế bao gồm: Audit hàng nghìn tin nhắn trên Slack để tìm sự cố lặp lại Xếp hạng và sàng lọc bộ hồ sơ ứng viên lớn một cách có hệ thống Chạy giải đấu loại trực tiếp tự động để chọn tên tốt nhất cho CLI tool Xử lý các nhiệm vụ vận hành đòi hỏi độ chính xác cao mà trước đây chỉ con người mới làm được Triết lý thiết kế là ràng buộc kiến trúc thay vì trí tuệ thô Điểm đáng chú ý nhất trong cách tiếp cận của Anthropic là triết lý thiết kế: thay vì cố gắng tăng trí thông minh thô của model, họ xây dựng các ràng buộc kiến trúc (architectural constraints) vào quy trình làm việc. Nói cách khác, thay vì hy vọng model tự biết cách tránh lỗi, họ thiết kế hệ thống sao cho lỗi khó xảy ra ngay từ đầu, và harness chính là công cụ thực thi triết lý đó. Dynamic Workflows cho thấy bước tiến tiếp theo của AI agent không nằm ở model thông minh hơn mà ở khả năng tự thiết kế quy trình. Giống cách một quản lý giỏi phân chia công việc cho đội ngũ thay vì tự làm tất cả, Claude giờ đây có thể tự tổ chức đội ngũ sub-agent của mình, và đây là tín hiệu rõ ràng rằng tương lai của AI coding không chỉ còn là viết code nhanh hơn mà là tổ chức công việc tốt hơn.

Nam•

5 thg 6, 2026

Đọc thêm

Claude Opus 4.8 ra mắt: model mạnh nhất của Anthropic có gì mới?

Anthropic vừa giới thiệu Claude Opus 4.8, phiên bản được hãng mô tả là model tổng quát mạnh nhất đang phát hành rộng rãi của mình. Bản nâng cấp này không chỉ tăng sức mạnh suy luận cho các tác vụ phức tạp, mà còn bổ sung nhiều thay đổi quan trọng cho nhà phát triển đang xây dựng tác nhân AI , hệ thống coding agent và workflow tự động hóa dài hơi. Điểm đáng chú ý là Claude Opus 4.8 không phải một bản đổi tên đơn thuần từ Opus 4.7 . Anthropic tập trung vào ba hướng chính: xử lý ngữ cảnh dài ổn định hơn, gọi công cụ đáng tin cậy hơn và kiểm soát chi phí tốt hơn trong các vòng lặp agent. Với model ID claude-opus-4-8, phiên bản này đã sẵn sàng cho Claude API và các nền tảng đám mây được hỗ trợ. Claude Opus 4.8 là gì? Claude Opus 4.8 hướng đến các tác vụ đòi hỏi suy luận nhiều bước, lập trình agentic trong thời gian dài và công việc có mức tự chủ cao. Theo tài liệu của Anthropic, model này hỗ trợ cửa sổ ngữ cảnh 1 triệu token mặc định trên Claude API, Amazon Bedrock và Google Vertex AI; riêng Microsoft Foundry hỗ trợ 200.000 token. Model cũng hỗ trợ output tối đa 128.000 token, adaptive thinking và các công cụ nền tảng tương tự Claude Opus 4.7. Điều này giúp nhóm đã dùng Opus 4.7 có thể nâng cấp tương đối nhẹ nhàng, nhưng vẫn cần kiểm tra một số thay đổi hành vi và ràng buộc API để tránh lỗi khi triển khai production. Những tính năng mới nổi bật Claude Opus 4.8 mang đến một số cập nhật trực tiếp tác động đến cách thiết kế prompt, quản lý hội thoại dài và tối ưu chi phí khi dùng API. Đây là những thay đổi rất đáng chú ý nếu bạn đang vận hành chatbot chuyên sâu, coding assistant hoặc agent nhiều bước. System messages giữa hội thoại Một điểm mới quan trọng là Claude Opus 4.8 cho phép thêm message có role: "system" ngay sau lượt người dùng trong mảng messages, miễn là tuân thủ quy tắc đặt message của Anthropic. Thay đổi này giúp developer cập nhật chỉ dẫn ở giữa một cuộc hội thoại dài mà không phải gửi lại toàn bộ system prompt ban đầu. Trong thực tế, đây là lợi thế lớn cho các agent phải chạy nhiều vòng. Thay vì làm mất hiệu quả prompt cache vì lặp lại phần chỉ dẫn dài, ứng dụng có thể bổ sung hướng dẫn mới đúng thời điểm, giữ lại cache cho phần hội thoại trước đó và giảm chi phí input trong các luồng xử lý kéo dài. Fast mode cho Claude API Anthropic cũng đưa fast mode vào Claude Opus 4.8 dưới dạng research preview trên Claude API. Khi đặt speed: "fast", người dùng có thể nhận tốc độ sinh output token cao hơn, với mức tăng được Anthropic mô tả là lên đến 2,5 lần trong điều kiện hỗ trợ. Fast mode sẽ đặc biệt hữu ích với các sản phẩm cần phản hồi nhanh nhưng vẫn muốn dùng cùng một model Opus mạnh. Tuy nhiên, tài liệu cũng lưu ý chế độ này đi kèm mức giá premium, vì vậy các đội kỹ thuật nên dùng có chọn lọc cho những luồng có giá trị cao hoặc yêu cầu độ trễ thấp. Prompt caching dễ dùng hơn Với Claude Opus 4.8, ngưỡng tối thiểu để một prompt có thể cache giảm xuống 1.024 token. Đây là thay đổi nhỏ nhưng có tác động thực tế lớn, vì nhiều prompt trước đây chưa đủ dài để tạo cache entry trên Opus 4.7 nay có thể được cache mà không cần sửa code. Đối với sản phẩm có system prompt ổn định, tài liệu nội bộ dài hoặc nhiều lượt gọi API lặp lại, prompt caching có thể giúp giảm chi phí đáng kể. Khi kết hợp với system messages giữa hội thoại, Claude Opus 4.8 trở nên phù hợp hơn cho các agent phải duy trì trạng thái qua nhiều bước xử lý. Refusal stop details được tài liệu hóa Anthropic cũng công khai tài liệu về đối tượng stop_details trong phản hồi từ chối. Khi model không thể hoàn thành một yêu cầu, ứng dụng không chỉ nhận stop reason dạng refusal, mà còn có thêm thông tin phân loại để hiểu vì sao yêu cầu bị từ chối. Điều này giúp sản phẩm xử lý UX tốt hơn. Ví dụ, thay vì hiển thị một thông báo lỗi chung chung, ứng dụng có thể phân biệt các nhóm từ chối khác nhau và hướng người dùng sang bước tiếp theo phù hợp hơn. Các ràng buộc API cần lưu ý Dù Anthropic nói các ràng buộc này kế thừa từ Claude Opus 4.7 và không phải breaking change với code đã chạy ổn trên bản trước, developer vẫn nên kiểm tra kỹ. Trên Messages API, Claude Opus 4.8 không hỗ trợ đặt temperature, top_p hoặc top_k sang giá trị không mặc định. Nếu truyền các tham số sampling này, API sẽ trả lỗi 400. Một điểm khác là adaptive thinking là chế độ thinking duy nhất được hỗ trợ. Cách cấu hình kiểu cũ với ngân sách thinking token cố định không còn phù hợp cho Opus 4.8. Thay vào đó, Anthropic khuyến nghị dùng thinking: {"type": "adaptive"} và điều chỉnh độ sâu suy luận bằng tham số effort. Trên Claude Opus 4.8, effort mặc định là high trên mọi bề mặt, bao gồm Claude API và Claude Code. Nếu ứng dụng đã đặt effort rõ ràng, cấu hình hiện tại vẫn được giữ nguyên; nếu chưa đặt, hành vi mặc định có thể khác so với kỳ vọng trước đây và cần được kiểm thử lại. Ý nghĩa với coding agent và workflow dài hơi Anthropic cho biết Claude Opus 4.8 nhắm đến các cải tiến trong coding agent dài hơi, bao gồm xử lý long-context tốt hơn, ít phải compaction hơn và phục hồi sau compaction ổn định hơn. Đây là nhóm tác vụ mà các model lớn thường gặp khó: sau nhiều bước đọc file, sửa code, chạy test và tóm tắt trạng thái, agent dễ mất trọng tâm hoặc bỏ qua chi tiết quan trọng. Model mới cũng được tối ưu để kích hoạt công cụ đúng lúc hơn. Với các hệ thống cần gọi search, database, terminal, browser hoặc API nội bộ, việc model ít bỏ sót tool call có thể tạo khác biệt lớn về độ tin cậy. Đây là điểm quan trọng hơn cả benchmark đơn lẻ, vì chất lượng agent trong môi trường thực tế phụ thuộc rất nhiều vào khả năng biết khi nào cần dùng công cụ. Có nên nâng cấp lên Claude Opus 4.8? Nếu bạn đang dùng Claude Opus 4.7 cho tác vụ suy luận phức tạp, lập trình hoặc agent tự động, Opus 4.8 là bản nâng cấp đáng thử sớm. Các thay đổi như context 1 triệu token, prompt cache minimum thấp hơn và system messages giữa hội thoại đều hướng đến bài toán vận hành thực tế, không chỉ cải thiện chất lượng trả lời trong các prompt ngắn. Tuy vậy, đội kỹ thuật không nên nâng cấp mù quáng. Hãy rà lại các tham số sampling, cấu hình thinking, kỳ vọng về effort mặc định và chi phí nếu muốn dùng fast mode. Với các sản phẩm đang xử lý dữ liệu nhạy cảm hoặc workflow quan trọng, nên chạy A/B test trên một nhóm tác vụ đại diện trước khi chuyển toàn bộ traffic sang Claude Opus 4.8. Kết luận Claude Opus 4.8 cho thấy Anthropic đang tập trung mạnh vào thị trường agent và developer. Các cải tiến lần này không chỉ nằm ở khả năng suy luận, mà còn ở những chi tiết vận hành như cache, system message giữa hội thoại, tốc độ output và phân loại refusal. Với những ai xây dựng sản phẩm AI nghiêm túc, đây là một bản phát hành đáng theo dõi vì nó giải quyết nhiều vấn đề rất thực tế trong triển khai ứng dụng AI dài hạn.

Nam•

29 thg 5, 2026

Đọc thêm