Quay lại trang tin tức

Cách kết nối Antigravity và Stitch thông qua MCP

Xuất bản vào 24 tháng 04, 2026
Cách kết nối Antigravity và Stitch thông qua MCP

Tóm tắt nhanh

Kết nối Google Stitch với Antigravity IDE qua MCP giải quyết bài toán kinh điển nhất của quy trình thiết kế đến lập trình: khoảng cách giữa bản thiết kế và code thực tế. Thay vì copy màu hex và spacing thủ công, agent trong Antigravity đọc trực tiếp "DNA thiết kế" từ Stitch theo thời gian thực qua MCP, sau đó tạo component React với Tailwind hoàn hảo đến từng pixel thông qua vòng lặp Stitch Loop: thiết kế, code, xác minh trực quan rồi tự sửa theo token gốc. Ở đây đưa ra toàn bộ quy trình từ tạo API key, cấu hình MCP, chạy vòng lặp, đến đóng gói DESIGN.md thành skill Antigravity tái sử dụng cho các dự án sau.

Khi bạn đã biết Google StitchAntigravity IDE rồi thì rất muốn kết hợp hai công cụ này với nhau để thay vì thiết kế giao diện xong rồi ngồi dịch thủ công từng màu sắc, font chữ và khoảng cách sang code, Google vừa công bố quy trình kết nối Google Stitch với Antigravity IDE qua MCP để agent tự đọc "DNA thiết kế" và viết code React hoàn hảo đến từng pixel. Bài này hướng dẫn toàn bộ quy trình, từ tạo thiết kế đến đóng gói thành skill tái sử dụng cho các dự án sau.

Tại sao cần kết nối Stitch với Antigravity qua MCP?

Vấn đề kinh điển của quy trình thiết kế đến lập trình là khoảng cách giữa hai bên: designer tạo ra giao diện đẹp trong Figma hay Stitch, lập trình viên nhận file rồi phải tự diễn giải màu sắc, khoảng cách, font và hành vi. Kết quả thường là code trông "gần giống" thay vì "đúng pixel".

MCP (Model Context Protocol) giải quyết khoảng cách này bằng cách cho phép Antigravity đọc trực tiếp siêu dữ liệu thiết kế từ Stitch theo thời gian thực, thay vì bạn phải xuất file hay copy mã màu thủ công. Agent không "đoán" thiết kế mà đọc đúng token gốc, tức là màu chính xác theo mã hex, spacing theo giá trị pixel, font theo tên thực và component theo cấu trúc thực của dự án.

Bước 1: Tạo thiết kế trong Google Stitch

Trước khi kết nối, cần có một dự án thiết kế trong Stitch làm nguồn thông tin gốc hoặc nếu có file Figma đã thiết kế sẵn rồi thì tải lên làm thiết kế cho dự án. Mình đã có bài trước đây nói rõ về Stitch rồi mọi người có thể tham khảo ở đây hoặc nếu đã có web, app đã chạy rồi thì có thể sử dụng tính năng redesign của Stitch.

Sau khi Stitch tạo ra giao diện thì nhớ chia từng phần ví dụ như trang chủ, tin tức, sản phẩm trước khi chuyển sang Antigravity. Đặt tên dự án rõ ràng vì tên này sẽ được dùng để gọi qua MCP. Ví dụ: LaunchPad.

Bước 2: Tạo API key và cấu hình MCP trong Antigravity

Tạo API key từ Stitch

Trong Stitch, nhấp vào ảnh hồ sơ góc trên bên phải, chọn Stitch settings, vào phần API key rồi nhấn Create key. Sao chép key ngay vì nó chỉ hiển thị một lần và lưu vào nơi an toàn.

Cách lấy API Key của Google Stitch
Cách lấy API Key của Google Stitch

Kết nối MCP trong Antigravity

Mở Antigravity IDE, vào Agent Manager (CMD+E trên Mac hoặc CTRL+E trên Windows), tạo workspace mới đặt tên ví dụ LaunchPad-Project và trỏ về thư mục local của dự án. Sau đó chúng ta có hai cách để thực hiện

Cách đầu tiên là prompt thẳng cho AI agent tự thực hiện các bước kết nối Antigravity tới Stitch thông qua MCP ví dụ “"Tôi đã có API key từ Stitch là đây [API key của Stitch] thực hiện các bước kết nối tới Stitch qua MCP và cuối cùng kiểm tra lại các kết nối.". Từ đó AI agent sẽ tự thực hiện các bước còn việc của chúng ta là ngồi chờ và accept các bước nếu AI agent cần cấp quyền.

Cách thứ hai thì chúng ta sẽ thực hiện thủ công các bước nhưng đừng lo lắng vì các bước thực hiện khá đơn giản và nhanh, mình đã thử và làm hoàn toàn nhanh hơn so với agent trong Antigravity vì thực sự cứ chạy một bước lại phải Retry trong Antigravity rất khó chịu. Các bước như sau:

  • Trong Agent Manager, chọn MCP Servers
  • Tìm kiếm "Stitch" và nhấn Install
  • Dán API key vào trường cấu hình khi được hỏi
Copy API key Google Stitch vào Antigravity
Copy API key Google Stitch vào Antigravity
  • Có thể kiểm tra kết nối bằng cách gõ vào cuộc trò chuyện: Kiểm tra các dự án Stitch đã kết nối thành công
  • Nếu agent trả về tên dự án LaunchPad thì kết nối đã thành công.

    Bước 3: Vòng lặp Stitch Loop từ thiết kế đến code

    Đây là phần cốt lõi của quy trình và cũng là điểm khác biệt lớn nhất so với cách làm truyền thống. Google gọi đây là "Stitch Loop" vì nó tạo ra vòng lặp liên tục giữa thiết kế và code thay vì một chiều từ designer sang developer.

    Giai đoạn tìm nạp ngữ cảnh thiết kế

    Trong cuộc trò chuyện Antigravity, gõ lệnh để agent tìm nạp toàn bộ DNA thiết kế:

    Agent sẽ gọi Stitch qua MCP, lấy toàn bộ token thiết kế bao gồm bảng màu hex, thang font, giá trị spacing, tên component và cấu trúc layout rồi lưu vào file DESIGN.md trong thư mục dự án của bạn. File này trở thành nguồn thông tin duy nhất mà mọi component sẽ tham chiếu.

    File DESIGN.md lấy trong Antigravity (nguồn Google)
    File DESIGN.md lấy trong Antigravity (nguồn Google)

    Giai đoạn tạo code

    Sau khi có DESIGN.md, giao cho agent xây dựng từng phần theo đúng token thiết kế:

    Agent tạo cấu trúc dự án React với Tailwind, viết từng component dựa trên token trong DESIGN.md, không dùng giá trị cứng. Điều này đảm bảo code và thiết kế luôn đồng bộ.

    Giai đoạn xác minh "Vibe Check"

    Antigravity có trình duyệt tích hợp cho phép agent mở localhost và so sánh trực quan với bản thiết kế Stitch gốc. Gõ:

    Agent liệt kê chính xác những điểm sai lệch và tự sửa theo token gốc. Đây là vòng lặp Stitch Loop: thiết kế trong Stitch, code trong Antigravity, xác minh qua trình duyệt, sửa theo token, lặp lại cho đến khi pixel-perfect.

    Bước 4: Đóng gói DESIGN.md thành skill tái sử dụng

    Đây là phần mọi người không hay để ý nhưng quan trọng nếu bạn làm nhiều dự án. File DESIGN.md được tạo ra từ quy trình trên chứa toàn bộ hệ thống thiết kế của một dự án cụ thể, nhưng bạn có thể đóng gói nó thành một skill Antigravity để tái sử dụng sang các dự án khác mà không cần lặp lại bước thiết lập từ đầu.

    Cấu trúc file DESIGN.md chuẩn để đóng gói

    Một DESIGN.md tốt nên có các phần sau để agent có thể đọc nhất quán:

    • Color tokens: Tên biến và giá trị hex cho từng màu trong hệ thống, ví dụ --color-primary: #1a1a2e, --color-accent: #7c3aed
    • Typography: Tên font, thang kích thước, line height và font weight cho heading, body và caption
    • Spacing scale: Bảng khoảng cách theo đơn vị px hoặc rem cho padding, margin và gap
    • Component inventory: Danh sách component, trạng thái (hover, active, disabled) và biến thể
    • Layout rules: Grid columns, breakpoints và max-width

    Chuyển DESIGN.md thành skill Antigravity

    Tạo thư mục .antigravity/skills/stitch-design/ trong workspace và đặt DESIGN.md vào đó cùng với file SKILL.md mô tả cách dùng skill này:

    Khi bật skill này trong một workspace mới, agent tự động đọc DESIGN.md trước khi viết bất kỳ component nào, đảm bảo mọi code đều tuân theo hệ thống thiết kế đã định nghĩa dù bạn không cần nhắc lại mỗi lần.

    Tái sử dụng cho dự án khác

    Khi bắt đầu dự án mới với hệ thống thiết kế tương tự, bạn chỉ cần cập nhật giá trị token trong DESIGN.md mà không cần viết lại toàn bộ hướng dẫn. Agent đọc file mới, áp dụng token mới, giữ nguyên quy trình. Đây là cách biến một lần thiết lập thành quy trình chuẩn dùng được mãi.

    Quy trình Stitch và Antigravity qua MCP không chỉ tiết kiệm thời gian ở bước chuyển đổi thiết kế sang code mà còn giải quyết vấn đề thường gặp hơn là duy trì sự nhất quán khi thiết kế thay đổi. Khi bạn cập nhật màu sắc hay khoảng cách trong Stitch, bạn chỉ cần chạy lại lệnh fetch token, cập nhật DESIGN.md và agent tự biết phải sửa gì trong codebase thay vì bạn phải tự tìm và thay thủ công từng giá trị.

    Thảo luận (0)

    Đăng nhập để tham gia thảo luận.

    Chưa có bình luận nào. Hãy là người đầu tiên!

    Các bài viết liên quan

    GPT-5.6 giảm giá API 80% có phải do áp lực từ Kimi K3?

    Chỉ hai tuần sau khi Kimi K3 ra mắt, OpenAI cắt giá API GPT-5.6 Luna tới 80%. Đây không phải là bằng chứng OpenAI phản ứng trực tiếp với Kimi K3, nhưng là dấu hiệu rõ ràng cho thấy cuộc đua AI năm 2026 đang dịch chuyển từ "ai thông minh hơn" sang "ai rẻ hơn với hiệu năng tương đương". OpenAI cắt giá API mạnh tay, Luna giảm tới 80% Từ ngày 30/7, OpenAI điều chỉnh giá API cho dòng GPT-5.6. GPT-5.6 Luna, phiên bản nhanh và có giá thấp nhất trong ba tier, giảm 80%, còn 0,20 USD cho mỗi triệu token input và 1,20 USD cho mỗi triệu token output. Terra, phiên bản cân bằng cho công việc hằng ngày, giảm 20%, còn 2 USD/12 USD cho mỗi triệu token input/output. GPT-5.6 Sol, flagship của dòng này, giữ nguyên giá nhưng có thêm Fast mode thay cho Priority Processing. Theo OpenAI, Fast mode xử lý nhanh hơn tối đa 2,5 lần so với Standard với giá gấp đôi, trong khi năng lực model không thay đổi. Mức giá mới cũng được phản ánh vào cách tính credit trên ChatGPT Work và Codex. Người dùng Terra hoặc Luna qua các gói này sẽ tiêu tốn ít credit hơn cho cùng một khối lượng công việc, dù giá gói thuê bao không đổi. Bạn có thể xem chi tiết giá mới tại thông báo chính thức của OpenAI. Có phải OpenAI đang chịu áp lực từ Kimi K3? OpenAI không nhắc trực tiếp đến Kimi K3 trong thông báo, vì vậy không thể khẳng định đợt giảm giá là phản ứng với riêng model này. Tuy nhiên, thời điểm của hai sự kiện khiến nhận định đó có cơ sở để bàn luận. Ngày 16/7, Moonshot AI ra mắt Kimi K3, một model open-weight có cửa sổ ngữ cảnh 1 triệu token. Chỉ trong vài ngày, Kimi K3 gây chú ý trong cộng đồng developer vì giá API cạnh tranh và hiệu năng cao hơn nhiều kỳ vọng dành cho một model có trọng số mở. Kimi K3 tiệm cận GPT-5.6 Sol ở đâu? Trên một số bảng benchmark, Kimi K3 tiệm cận GPT-5.6 Sol bản max; khoảng cách tổng thể vẫn còn, nhưng nhỏ hơn đáng kể so với kỳ vọng trước đây về một model open-weight. Kimi K3 còn dẫn đầu ở một vài thước đo cụ thể như FrontierSWE, BrowseComp và Frontend Code Arena, trong khi giá API ở mức 3 USD/15 USD cho mỗi triệu token input/output, thấp hơn Sol. Sol vẫn có lợi thế ở nhiều benchmark tổng hợp và có chế độ Ultra multi-agent đạt 91,9% trên Terminal-Bench 2.1. Dù vậy, việc một model open-weight áp sát flagship đóng của OpenAI với mức giá thấp hơn đã tạo ra áp lực cạnh tranh thực sự, nhất là với doanh nghiệp và developer nhạy cảm với chi phí vận hành dài hạn. Bạn có thể so sánh các model trên bảng xếp hạng 4AIVN. Việc liên hệ đợt giảm giá với Kimi K3 là nhận định dựa trên thời điểm và bối cảnh thị trường, không phải xác nhận chính thức từ OpenAI. Bức tranh giá AI toàn ngành đang thay đổi Kimi K3 không phải là áp lực duy nhất. DeepSeek tiếp tục theo đuổi chiến lược giá thấp: DeepSeek V4 Flash được niêm yết ở mức 0,14 USD/0,28 USD mỗi triệu token, còn DeepSeek V4 Pro ở mức 0,435 USD/0,87 USD; cả hai đều đi kèm cửa sổ ngữ cảnh 1 triệu token. Ngay cả sau khi giảm 80%, GPT-5.6 Luna ở mức 0,20 USD/1,20 USD vẫn đắt hơn DeepSeek V4 Flash ở đầu ra, dù khoảng cách đã thu hẹp đáng kể. Đợt điều chỉnh của OpenAI vì thế phù hợp với một xu hướng lớn hơn, không chỉ là phản ứng đơn lẻ trước Kimi K3. Các lab Trung Quốc liên tục kéo giá xuống trong khi vẫn giữ hiệu năng cạnh tranh, buộc các công ty Mỹ phải tối ưu chiến lược định giá nhanh hơn trước. Người dùng được lợi gì? Với người dùng ChatGPT không sử dụng API, tác động trực tiếp gần như không có vì giá thuê bao không đổi. Nhưng với đội ngũ đang xây dựng ứng dụng, chatbot hoặc agent tự động dựa trên GPT-5.6 API, đây là một thay đổi đáng kể. Các công cụ như Hermes Agent, vốn cho phép chọn GPT-5.6 Sol, Terra hoặc Luna làm model nền, có thể giảm chi phí vận hành rõ rệt khi dùng đúng tier cho từng loại việc. Luna phù hợp với tác vụ lặp lại, khối lượng lớn và không cần suy luận phức tạp.Terra là lựa chọn cân bằng cho công việc hằng ngày và trợ lý đa năng.Sol vẫn phù hợp nhất khi độ chính xác và năng lực suy luận cao là ưu tiên. Góc nhìn 4AIVN Khoảng cách hiệu năng giữa những model hàng đầu đang thu hẹp nhanh hơn khoảng cách giá. Khi một model open-weight như Kimi K3 có thể áp sát model đóng đầu bảng, các công ty lớn phải cân nhắc giữa bảo vệ biên lợi nhuận và giữ chân khách hàng doanh nghiệp. Động thái của OpenAI cho thấy hãng chọn cải thiện hiệu năng trên mỗi USD, ít nhất với Luna và Terra. Nếu đang vận hành ứng dụng hoặc agent trên GPT-5.6 API, đây là lúc nên phân bổ lại tác vụ giữa Sol, Terra và Luna thay vì dùng một model duy nhất cho mọi việc. Chênh lệch giá giữa ba tier giờ đủ lớn để lựa chọn model theo từng tác vụ trở thành quyết định tối ưu chi phí thực sự, không chỉ là lựa chọn kỹ thuật.

    Liên
    31 thg 7, 2026
    Claude Opus 5 ra mắt với sức mạnh áp sát Fable 5

    Anthropic vừa ra mắt Claude Opus 5 với mức giá giữ nguyên như Opus 4.8 nhưng chất lượng trả lời được nâng lên gần bằng Fable 5, model đắt gấp đôi. Nói cách khác, với mức giá bằng một nửa Fable 5 mà hiệu năng lại áp sát, phần lớn người dùng nhiều khả năng sẽ chọn Opus 5 làm model mặc định, chỉ giữ Fable 5 cho số ít tác vụ thật sự cần đến giới hạn cao nhất. Claude Opus 5 mang đến những nâng cấp nào? Theo thông báo ra mắt của Anthropic, Claude Opus 5 là model Opus mạnh nhất tính đến nay và là đại diện đầu tiên của dòng Opus thuộc thế hệ Claude 5. Anthropic mô tả đây là model chủ động, biết suy nghĩ sâu và tiến gần trí tuệ cấp cao nhất của Claude Fable 5 trong nhiều lĩnh vực, nhưng chỉ tốn một nửa chi phí token. Model có mã API claude-opus-5, context mặc định và tối đa 1 triệu token, tương tự Opus 4.8 và Fable 5, cùng giới hạn đầu ra 128.000 token và chế độ thinking được bật mặc định. Nó đã trở thành model mặc định trên Claude Max và là model mạnh nhất khả dụng trên Claude Pro, đồng thời có mặt trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và cả GitHub Copilot. Vì sao nhiều người sẽ chọn Opus 5 thay vì Fable 5? Câu trả lời không chỉ nằm ở con số giá. Có bốn lý do khiến Opus 5 nhiều khả năng trở thành lựa chọn mặc định cho công việc hằng ngày, trong khi Fable 5 lùi về vai trò công cụ chuyên dụng cho số ít trường hợp đặc biệt. Thắng nhiều hơn thua trên các bài kiểm tra thực tế Trên Frontier-Bench v0.1, bài kiểm tra coding tự động của chính Anthropic, Opus 5 đạt 43,3% trong khi Fable 5 chỉ đạt 33,7%, một khoảng cách gần 10 điểm nghiêng hẳn về Opus 5. Trên CursorBench 3.2 ở mức effort tối đa, Opus 5 đạt khoảng 70,1%, thua Fable 5 chưa tới nửa điểm phần trăm nhưng chi phí chỉ bằng một nửa. Tính chung trên các bài kiểm tra mà cả hai model đều có số liệu, Opus 5 thắng nhiều hơn thua và phần thắng thường lớn hơn phần thua. Cách kiểm chứng nhanh nhất: chạy cùng một tác vụ trên cả hai model ở effort tương đương, rồi so sánh chất lượng đầu ra thay vì chỉ nhìn benchmark được công bố. Không bị ép giữ dữ liệu 30 ngày Fable 5 và Mythos 5 thuộc nhóm Covered Models, bắt buộc lưu giữ prompt và kết quả trong 30 ngày để phục vụ công tác an toàn, đồng thời không hỗ trợ zero data retention (ZDR) trên bất kỳ nền tảng nào, kể cả khi tổ chức đã có thỏa thuận ZDR từ trước. Ngược lại, Opus 5 vẫn vận hành được dưới ZDR như Opus 4.8. Với các đội ngũ xử lý dữ liệu pháp lý, y tế hoặc tài chính, riêng điểm này đã đủ để loại Fable 5 khỏi danh sách lựa chọn mà không cần so hiệu năng. Ít bị gián đoạn bởi bộ lọc an toàn Anthropic cho biết bộ phân loại an ninh mạng của Opus 5 can thiệp ít hơn khoảng 85% so với Fable 5. Với các coding agent chạy nhiều giờ hoặc qua đêm, việc bị chặn giữa chừng vì request chạm ngưỡng an toàn là rủi ro thực sự làm gián đoạn quy trình, và Opus 5 giảm đáng kể tần suất đó. Effort điều chỉnh được, ngân sách dễ đoán hơn Opus 5 hỗ trợ adaptive thinking với effort từ thấp đến tối đa. Mức thấp hoặc trung bình phù hợp cho phản hồi nhanh và khối lượng lớn, còn mức cao hoặc tối đa dành cho coding phức tạp, nghiên cứu sâu và quy trình nhiều bước. Vì phải trả tiền theo effort đã chọn thay vì bị khóa vào một mức giá cố định như Fable 5, đội ngũ có thể tối ưu ngân sách theo từng loại tác vụ thay vì trả giá cao nhất cho mọi request. Cảm nhận ban đầu sau khi dùng thử Opus 5 Sau khi dùng thử Opus 5 cho công việc viết lách và xử lý code hằng ngày, cảm nhận rõ nhất là model này thông minh hơn hẳn Opus 4.8, đặc biệt ở khả năng hiểu ý đồ ngay từ lần yêu cầu đầu tiên mà không cần giải thích lại nhiều lần. Với các tác vụ như tóm tắt tài liệu dài, viết code có logic rẽ nhánh phức tạp hoặc lên kế hoạch nhiều bước, Opus 5 xử lý mượt và ít khi đi lạc đề như bản cũ thường gặp. So với Fable 5 thì vẫn có khoảng cách, dù không lớn như tưởng tượng. Ở những tác vụ đòi hỏi suy luận sâu hoặc phải tự chủ qua nhiều bước liên tiếp mà không có ai can thiệp, Fable 5 vẫn xử lý chắc tay và ít sai sót hơn một chút. Nhưng với phần lớn công việc hằng ngày, mức chênh lệch đó khó nhận ra nếu không đặt hai model cạnh nhau để so sánh trực tiếp. Nếu bạn đang dùng Opus 4.8, đây là thời điểm hợp lý để nâng cấp. Còn nếu đang cân nhắc giữa Opus 5 và Fable 5 cho công việc thông thường, Opus 5 gần như đủ dùng mà không cần trả thêm tiền. Khi nào Fable 5 vẫn là lựa chọn đúng? Fable 5 vẫn giữ được lợi thế ở đúng những chỗ khó nhất. Trên SWE-bench Pro, bộ kiểm tra dùng vấn đề GitHub có thật và được xem là thước đo khắt khe nhất cho công việc coding thực tế, Fable 5 đạt khoảng 80% trong khi Opus 5 đạt khoảng 79%, một khoảng cách nhỏ nhưng vẫn nghiêng về Fable 5. Fable 5 cũng là model duy nhất Anthropic định vị ở cấp Mythos, tức năng lực tổng thể cao hơn Opus theo thiết kế, và điều này thể hiện rõ ở các lĩnh vực chuyên sâu như phân tích y tế chuyên môn hoặc nghiên cứu tự chủ kéo dài nhiều ngày mà không có người giám sát. Nói cách khác, phần thắng của Opus 5 tập trung ở công việc coding và xử lý tri thức hằng ngày, còn lợi thế của Fable 5 nằm ở những bài toán khó nhất và các lĩnh vực đòi hỏi độ tin cậy tuyệt đối. Với đa số người dùng và đội ngũ nhỏ, những bài toán đó chiếm tỷ trọng rất nhỏ trong công việc thường ngày, nên khoản chênh lệch giá gấp đôi khó biện minh được, trừ khi công việc của bạn rơi đúng vào nhóm này. So sánh nhanh Opus 5 và Fable 5 Tiêu chíClaude Opus 5Claude Fable 5 Giá đầu vào5 USD/triệu token10 USD/triệu token Giá đầu ra25 USD/triệu token50 USD/triệu token Context1 triệu token1 triệu token Đầu ra tối đa128.000 token128.000 token Frontier-Bench v0.1 (coding agent)43,3%33,7% SWE-bench Pro (coding thực tế)~79%~80% Lưu giữ dữ liệuHỗ trợ zero data retentionBắt buộc lưu giữ 30 ngày, không có ZDR Tần suất chặn bởi bộ lọc an toànThấp hơn khoảng 85%Cao hơn Phù hợp nhấtCông việc hằng ngày, coding agent, dữ liệu nhạy cảmNghiên cứu khó, dự án tự chủ dài ngày, phân tích y tế chuyên sâu Vậy Opus 5 có thật sự đọ được với GPT-5.6? Trên giấy tờ, câu trả lời là có, nhưng không phải toàn diện. Opus 5 dẫn trước GPT-5.6 Sol ở khả năng suy luận với tình huống mới, thao tác máy tính và phần lớn bài kiểm tra coding công khai, trong khi GPT-5.6 Sol vẫn nhỉnh hơn ở một số bài kiểm tra thao tác dòng lệnh và tìm kiếm thông tin. Không bên nào thắng tuyệt đối, nhưng lần đầu tiên một model tầm giá trung của Anthropic đứng ngang hàng, thậm chí nhỉnh hơn ở nhiều mặt so với model đầu bảng của OpenAI. Câu hỏi đáng quan tâm hơn không phải model nào mạnh hơn mà là model nào thực sự phù hợp với bạn. Nếu công việc hằng ngày xoay quanh code, tài liệu dài và tác vụ nhiều bước, Opus 5 đang là lựa chọn hợp lý cả về giá lẫn chất lượng. Còn nếu bạn đã quen với hệ sinh thái OpenAI hoặc cần đúng thế mạnh của GPT-5.6, chi phí chuyển đổi có thể không đáng để thay đổi. Cách trả lời chắc chắn nhất vẫn là tự chạy thử cùng một việc trên cả hai, vì bảng benchmark không phải lúc nào cũng phản ánh đúng trải nghiệm thật.

    Nam
    25 thg 7, 2026
    ChatGPT Health ra mắt, kết nối hồ sơ y tế và Apple Health

    Mỗi tuần có hơn 300 triệu người dùng ChatGPT để hỏi về sức khỏe, từ đọc kết quả xét nghiệm đến chuẩn bị câu hỏi cho bác sĩ. Vấn đề là hơn 70% các cuộc trò chuyện đó lại xảy ra ngoài không gian Health riêng biệt mà OpenAI xây dựng cho mục đích này. Đó chính là lý do OpenAI vừa mở rộng Health trong ChatGPT ra toàn bộ người dùng đủ điều kiện tại Mỹ, cho phép kết nối Apple Health và hồ sơ y tế để AI dùng dữ liệu cá nhân ngay trong mọi cuộc trò chuyện, không chỉ trong một tab riêng. ChatGPT Health không phải tính năng hoàn toàn mới OpenAI lần đầu giới thiệu ChatGPT Health vào ngày 7/1/2026, dưới dạng thử nghiệm giới hạn theo danh sách chờ cho một nhóm nhỏ người dùng. Ở giai đoạn đó, các cuộc trò chuyện về sức khỏe buộc phải diễn ra trong một không gian Health tách biệt, và việc phải chuyển qua lại giữa các tab tạo ra rào cản đủ lớn khiến phần lớn người dùng vẫn hỏi sức khỏe ngay trong khung chat thông thường thay vì mở Health. Đợt triển khai ngày 23/7 vừa qua thực tế là bản mở rộng toàn diện, không phải lần ra mắt đầu tiên. OpenAI đưa Health đến tất cả người dùng Mỹ đủ điều kiện trên các gói Free, Go, Plus và Pro, đồng thời bỏ luôn rào cản không gian riêng: một khi đã cấp quyền, ChatGPT có thể dùng dữ liệu sức khỏe đã kết nối ở bất kỳ đâu trong ứng dụng, kể cả khi người dùng chỉ đang hỏi về thực đơn hay lịch tập. ChatGPT Health ra mắt với những khả năng nào? Người dùng có thể kết nối Apple Health cùng hồ sơ y tế từ các hệ thống bệnh viện được hỗ trợ, One Medical hoặc Function Health. Khi được cấp quyền, ChatGPT có thể dùng dữ liệu liên quan để so sánh kết quả xét nghiệm mới với những lần trước, tóm tắt thay đổi kể từ buổi khám gần nhất hoặc tìm mối liên hệ giữa giấc ngủ, vận động và thói quen hằng ngày. Mục tiêu là giảm việc người dùng phải liên tục thu thập, tải lên và giải thích lại cùng một thông tin cho AI mỗi lần trò chuyện. Dữ liệu sức khỏe được đưa vào cuộc trò chuyện như thế nào? Health vẫn là nơi người dùng kết nối và quản lý dữ liệu, xem xu hướng gần đây, duyệt hồ sơ đã đồng bộ và quay lại các cuộc trò chuyện sức khỏe trước đó. Nhưng khác với bản thử nghiệm ban đầu, sau khi đồng bộ, thông tin phù hợp có thể được dùng trong những cuộc trò chuyện thông thường nếu người dùng cho phép, thay vì bắt buộc phải mở không gian riêng. Gõ @Health vào câu hỏi cũng là cách yêu cầu ChatGPT chủ động đưa ngữ cảnh sức khỏe vào phản hồi. ChatGPT có thể sử dụng những dữ liệu nào? Dữ liệu có thể bao gồm thuốc đang dùng, kết quả xét nghiệm, lần khám gần đây, giấc ngủ, mức vận động và bài tập. Nếu ứng dụng thiết bị đeo hoặc dinh dưỡng chia sẻ dữ liệu với Apple Health, ChatGPT có thể sử dụng phần dữ liệu được chuyển tiếp khi người dùng cấp quyền, dù OpenAI lưu ý một số chỉ số độc quyền của bên thứ ba có thể không được chuyển sang. Người dùng vẫn quyết định thời điểm cấp quyền Mặc định, ChatGPT sẽ hỏi trước khi dùng hồ sơ y tế hoặc Apple Health để cá nhân hóa câu trả lời. Người dùng có thể cho phép một lần, luôn cho phép hoặc thay đổi thiết lập sau đó, và có thể ngắt kết nối bất kỳ lúc nào trong Health > Accounts. Quyền riêng tư là phần quan trọng nhất, nhưng không tuyệt đối Theo công bố chính thức của OpenAI, hồ sơ y tế, dữ liệu Apple Health và các cuộc trò chuyện sử dụng những dữ liệu này không được dùng để huấn luyện mô hình nền tảng hoặc nhắm mục tiêu quảng cáo, bất kể thiết lập huấn luyện thông thường của tài khoản. Dữ liệu kết nối được bảo vệ bằng các lớp mã hóa bổ sung bên cạnh mã hóa khi lưu trữ và truyền tải. Khi ngắt kết nối một nguồn dữ liệu, thông tin đồng bộ từ nguồn đó sẽ bị xóa khỏi hệ thống của OpenAI trong vòng 30 ngày, nhưng thông tin đã xuất hiện trong lịch sử trò chuyện vẫn tồn tại cho đến khi người dùng tự xóa cuộc trò chuyện tương ứng. Điều ít được nói đến hơn là một khi dữ liệu y tế rời khỏi hệ thống của bệnh viện hay phòng khám để vào ChatGPT, nó không còn nằm dưới sự bảo vệ của HIPAA, đạo luật bảo mật y tế của Mỹ. Toàn bộ cam kết về bảo mật và không dùng để huấn luyện mô hình hiện chỉ dựa trên điều khoản dịch vụ tự nguyện của OpenAI, không phải nghĩa vụ pháp lý bắt buộc như với hồ sơ y tế trong hệ thống bệnh viện truyền thống. Dữ liệu sức khỏe có thể thiếu hoặc lỗi thời, chẳng hạn một loại thuốc vẫn còn trong hồ sơ dù người dùng đã ngừng sử dụng. Hãy kiểm tra thông tin quan trọng với nguồn gốc ban đầu và chuyên gia y tế, đồng thời cân nhắc kỹ trước khi kết nối những dữ liệu thực sự nhạy cảm. GPT-5.6 Sol được dùng cho câu hỏi sức khỏe phức tạp OpenAI cho biết GPT-5.5 Instant mang khả năng trả lời câu hỏi sức khỏe đến người dùng miễn phí, còn GPT-5.6 Sol là lựa chọn mạnh nhất của hãng cho các câu hỏi cần suy luận qua nhiều chi tiết, dành cho người dùng trả phí. Các tình huống được nhắc đến gồm giải thích ghi chú buổi khám bằng ngôn ngữ dễ hiểu, theo dõi biến động xét nghiệm và chuẩn bị câu hỏi cho lần tái khám. OpenAI làm việc với hơn 260 bác sĩ tại 60 quốc gia để xây dựng tình huống và tiêu chí đánh giá, với hơn 600.000 lượt chấm điểm đầu ra mô hình trên 30 lĩnh vực sức khỏe khác nhau. Các tiêu chí gồm độ chính xác, an toàn, giao tiếp, nhận biết ngữ cảnh, mức độ đầy đủ và khả năng chuyển người dùng đến hỗ trợ chuyên môn khi cần. Tuy vậy, công ty vẫn cảnh báo ChatGPT có thể đưa ra thông tin sai lệch, đây vẫn đang là điểm yếu chung của các mô hình AI trong lĩnh vực đòi hỏi độ chính xác tuyệt đối. ChatGPT Health hữu ích nhưng hoàn toàn không thay thế được bác sĩ Lợi ích rõ nhất của Health là gom dữ liệu vốn nằm rải rác trong cổng bệnh nhân, ứng dụng và thiết bị đeo thành ngữ cảnh có thể đặt câu hỏi. Điều này có thể giúp người dùng hiểu lịch sử sức khỏe, chuẩn bị tốt hơn cho cuộc hẹn và trao đổi rõ ràng hơn với bác sĩ. Rủi ro cũng lớn hơn một cuộc trò chuyện thông thường vì câu trả lời liên quan trực tiếp đến dữ liệu nhạy cảm và quyết định sức khỏe. Người dùng không nên tự thay đổi thuốc, trì hoãn cấp cứu hoặc đưa ra quyết định điều trị chỉ dựa trên phản hồi của AI, mà vẫn cần tuân theo chỉ dẫn của bác sĩ thực sự. Người dùng ngoài nước Mỹ nên nhìn nhận tính năng này thế nào? Cả hai đợt triển khai của ChatGPT Health, từ bản thử nghiệm tháng 1 đến bản mở rộng tháng 7, đến nay vẫn giới hạn trong nước Mỹ. Riêng phần kết nối hồ sơ y tế từ hệ thống bệnh viện luôn chỉ dành cho Mỹ ngay từ đầu, còn EU, Anh và Thụy Sĩ bị loại khỏi cả hai đợt vì các quy định bảo mật dữ liệu nghiêm ngặt hơn và khả năng tính năng này bị xếp vào nhóm rủi ro cao theo EU AI Act. OpenAI chưa công bố bất kỳ mốc thời gian nào cho việc mở rộng ra ngoài nước Mỹ, bao gồm cả các thị trường châu Á như Việt Nam. Với người dùng ChatGPT ở các khu vực chưa có Health, có vài điều đáng lưu ý. Trước hết, việc chưa kết nối được hồ sơ y tế không có nghĩa là không thể hỏi ChatGPT về sức khỏe, chỉ là câu trả lời sẽ dựa trên thông tin người dùng tự mô tả thay vì dữ liệu đồng bộ tự động. Kế đến, ngay cả khi tính năng này chưa khả dụng, người dùng vẫn nên thận trọng khi dán nguyên văn kết quả xét nghiệm hay hồ sơ bệnh án vào khung chat thông thường, vì mức bảo vệ dữ liệu sẽ khác so với khi dùng qua không gian Health có mã hóa bổ sung. Cuối cùng, giá trị thực sự của Health khi đến các thị trường khác sẽ phụ thuộc vào việc có bao nhiêu hệ thống y tế địa phương hỗ trợ kết nối, vì phần hồ sơ bệnh viện tại Mỹ khó áp dụng trực tiếp cho hạ tầng y tế của từng nước. Đây là một bước tiến đáng chú ý trong việc cá nhân hóa ChatGPT, nhưng thành công thực tế sẽ được quyết định bởi chất lượng dữ liệu, quyền kiểm soát của người dùng và cách AI biết dừng lại đúng lúc để chuyển giao cho chuyên gia y tế thay vì tự đưa ra kết luận.

    Liên
    25 thg 7, 2026
    Gemini 3.6 Flash ra mắt nhưng thực chiến gây thất vọng

    Google công bố Gemini 3.6 Flash ngày 21/7/2026 với hàng loạt điểm benchmark tăng vọt so với 3.5 Flash: DeepSWE từ 37% lên 49%, MLE Bench từ 49,7% lên 63,9% và OSWorld Verified đạt 83%. Nhưng trải nghiệm sử dụng thực tế của 4AIVN lại kể một câu chuyện khác hẳn: model xử lý việc nhỏ khá ổn, còn khi được giao một kế hoạch nhiều bước thì lại quên mục tiêu, bỏ sót bước và đi lệch hướng giữa chừng. Benchmark tăng mạnh nhưng không phản ánh đúng việc dùng thật Theo thông báo chính thức của Google, Gemini 3.6 Flash dùng ít hơn 17% token đầu ra so với 3.5 Flash trên Artificial Analysis Index; một số bài test như DeepSWE ghi nhận mức giảm token tới 65%. Cửa sổ đầu vào của model đạt 1.048.576 token và giới hạn đầu ra là 65.536 token, những con số nghe rất ấn tượng trên giấy. Vấn đề nằm ở chỗ tất cả những con số này đều đến từ các bài test được thiết kế sẵn, có mục tiêu cố định ngay từ đầu và chạy trong một phiên ngắn. Đó không phải cách một plan thực tế vận hành, vì công việc thật luôn cần điều chỉnh liên tục theo phản hồi, chứ không phải hoàn thành xong một lượt là kết thúc. Bám plan dài là điểm yếu chí mạng Trong trải nghiệm sử dụng thực tế, Gemini 3.6 Flash thể hiện quá kém ngay khi bước ra khỏi phạm vi một task đơn lẻ. Giao việc nhỏ, có bước kiểm tra rõ ràng thì model làm tốt và ít vòng lặp thừa. Nhưng khi được giao một kế hoạch nhiều bước, model bắt đầu quên mục tiêu ban đầu, bỏ sót các bước đã thống nhất từ trước hoặc tự ý đi lệch hướng sau vài lượt trao đổi. Khi được nhắc lại, model đôi khi chỉ xin lỗi rồi lặp lại đúng lỗi cũ thay vì thực sự sửa. Cửa sổ 1 triệu token mô tả sức chứa đầu vào, không phải khả năng ghi nhớ. Model có thể “nhìn thấy” toàn bộ context nhưng vẫn bỏ sót chi tiết khi thực hiện; chỉ cần một điểm nhỏ không được chú ý là kế hoạch có thể lệch hướng ngay. Đây không phải lỗi ngẫu nhiên hiếm gặp mà là điểm yếu lặp lại đủ nhiều để không thể bỏ qua. Nói cách khác, Gemini 3.6 Flash mạnh ở việc làm nhanh một tác vụ, nhưng chưa đáng tin khi phải thực hiện đúng một chuỗi tác vụ, và đó chính là khoảng cách mà benchmark không đo được. Giá giảm 17% nhưng chất lượng chưa chắc tương xứng Giá niêm yết của Gemini 3.6 Flash là 1,50 USD cho một triệu token đầu vào và 7,50 USD cho một triệu token đầu ra, giảm khoảng 17% so với mức 9 USD của 3.5 Flash. Nghe qua, đây là một bước tiến hợp lý: rẻ hơn mà benchmark lại cao hơn. Nhưng nếu chất lượng thực thi trên các tác vụ dài lại kém, phần tiết kiệm chi phí trên giấy có thể bị nuốt gọn bởi số lần phải nhắc lại, sửa lại hoặc chạy lại toàn bộ kế hoạch từ đầu. Gemini 3.5 Flash Lite còn rẻ hơn, với giá 0,30 USD cho một triệu token đầu vào và 2,50 USD cho đầu ra, nhưng đó là lựa chọn dành cho phân loại và chuyển đổi dữ liệu đơn giản, những việc không đòi hỏi model phải nhớ một kế hoạch dài. Được gì, mất gì khi dùng Gemini 3.6 Flash? Nhìn một cách khách quan, đây không phải là một bản nâng cấp thất bại. Google có lẽ đã tính toán rất kỹ để tối ưu giữa chất lượng đầu ra, tốc độ và chi phí, dù kết quả thực tế chưa hẳn đáp ứng kỳ vọng cao dành cho đội ngũ kỹ sư của họ. Những cải thiện này hoàn toàn rõ ràng chứ không chỉ dừng lại trên lý thuyết: tốc độ phản hồi nhanh hơn, chi phí đầu ra giảm đáng kể và với các tác vụ ngắn, phạm vi hẹp như phân loại nội dung, viết một hàm code đơn lẻ hoặc giải quyết một câu hỏi cụ thể, model xử lý rất gọn gàng, hạn chế các vòng lặp thừa. Nhưng cái giá phải trả lộ ra ngay khi công việc kéo dài quá một vài bước. Model càng phải giữ nhiều ràng buộc và nhớ nhiều quyết định đã thống nhất trước đó thì tỷ lệ đi lệch càng tăng. Với coding agent hoặc quy trình dài đang chạy ổn định trên Claude Fable 5 hoặc GPT 5.6, chưa có lý do đủ thuyết phục để đổi sang Gemini 3.6 Flash chỉ vì benchmark hoặc giá thấp hơn. Vẫn phải chờ Gemini 3.5 Pro Google cho biết Gemini 3.5 Pro vẫn đang được thử nghiệm cùng các đối tác và sẽ được phát hành rộng rãi khi sẵn sàng. Vì vậy, câu chuyện cốt lõi của đợt phát hành này nằm ở khoảng cách khá xa giữa benchmark và thực tế công việc. Với những ai đang tìm kiếm một agent đủ tin cậy cho các quy trình dài hạn, có lẽ họ vẫn phải kiên nhẫn chờ xem 3.5 Pro có tạo nên bước ngoặt mới hay không. Nếu các phiên bản tiếp theo tiếp tục thể hiện mờ nhạt trong thực chiến, Google có nguy cơ tự tay nhường lợi thế cho các đối thủ như Anthropic, OpenAI và Meta.

    Nam
    23 thg 7, 2026