Gặp gỡ SIMA 2 – Trợ lý AI chơi game có thể suy nghĩ như người thật!

Xuất bản vào 17 tháng 11, 2025

Tóm tắt nhanh

Google DeepMind giới thiệu SIMA 2, tác nhân AI đa năng với lõi Gemini 2.5 Flash Lite, có khả năng suy nghĩ, lý luận và tự học trong thế giới ảo 3D. SIMA 2 đạt hiệu suất 65% trong các nhiệm vụ phức tạp, cải thiện đáng kể so với SIMA 1 và tiệm cận khả năng của con người. Nó có thể hiểu nhiều dạng chỉ dẫn (văn bản, giọng nói, biểu tượng cảm xúc) và các ngôn ngữ khác nhau, đồng thời khái quát hóa kiến thức giữa các trò chơi. SIMA 2 còn tự cải thiện hiệu suất qua cơ chế học hỏi thử-và-sai. Đây là bước tiến quan trọng hướng tới Trí tuệ nhân tạo tổng quát (AGI) và ứng dụng trong robot thực tế.

Bạn đã từng chơi game cùng một đồng đội AI (bot) hoặc NPC chỉ biết làm theo lệnh cứng nhắc? Hãy quên điều đó đi! Google DeepMind vừa công bố SIMA 2 (viết tắt của Scalable Instructable Multiworld Agent) tiếp nối SIMA 1, một tác nhân AI thế hệ mới, đa năng, được thiết kế để không chỉ chơi game mà còn suy nghĩ, lý luận và tự học trong các thế giới ảo 3D phức tạp.

Việc ra mắt SIMA 2 có thể được coi là một cột mốc quan trọng, đưa chúng ta tiến gần hơn đến trí tuệ nhân tạo tổng quát (AGI). AGI luôn luôn là mục tiêu tối thượng của toàn bộ các ông lớn như Google, Open AI, Microsoft tạo ra hệ thống AI có thể thực hiện nhiều loại nhiệm vụ trí tuệ khác nhau, giống như con người.

Nâng cấp bộ não với sức mạnh Gemini 2.5 Flash Lite

SIMA 2 đã được nhận được cập nhật lớn về trí tuệ nhờ được tích hợp mô hình ngôn ngữ lớn Gemini 2.5 Flash Lite làm lõi suy luận. Điều này đã giúp SIMA từ một tác nhân AI chỉ biết "thực hiện chỉ thị" (instruction-follower) thành một người bạn đồng hành hơn.

Tỷ lệ hoàn thành nhiệm vụ

Nguồn: Google DeepMind

SIMA 2 thông minh hơn SIMA 1 so sánh với con người như thế nào?

SIMA 1 (ra mắt năm 2024) chỉ đạt tỷ lệ hoàn thành các nhiệm vụ phức tạp khoảng 31%.
SIMA 2 đã tăng gấp đôi hiệu suất, đạt mức trung bình 65% tỷ lệ hoàn thành nhiệm vụ trên bộ đánh giá chính, tiệm cận với khả năng của con người (khoảng 76%).

Khả năng suy nghĩ thật sự (Không phải hành động lặp lại)

Nhờ có Gemini, SIMA 2 sở hữu khả năng lý luận trừu tượng mà các bot trước đây không làm được. Nó không chỉ làm theo lệnh mà còn hình thành kế hoạch nội bộ và giải thích các bước hành động của mình.

Nhìn ví dụ về lý luận dưới đây: Nếu bạn đang chơi game và nói: "Hãy đi đến ngôi nhà có màu giống quả cà chua chín".

Một bot cũ sẽ bị "đứng hình" vì bạn không nói màu cụ thể, nhưng đối với SIMA 2 thì nó sẽ sử dụng lõi Gemini để suy luận: "Quả cà chua chín có màu đỏ. Vậy mình phải tìm và đi đến ngôi nhà màu đỏ".

Ví dụ SIMA 2 hiểu ngôi nhà màu đỏ — SIMA 2 Agent

SIMA 2 thực hiện các hành động này bằng cách quan sát hình ảnh trên màn hình và sử dụng bàn phím/chuột ảo để điều khiển nhân vật hoặc công cụ mô phỏng hành vi giống hệt như một người chơi bình thường. Đây là lý do tại sao nó được gọi là một tác nhân hiện thân (embodied agent)—một hệ thống tương tác cho phép AI cảm nhận trong thế giới ảo (hoặc thực) và tất nhiên là có đi kèm với điểm hiệu suất sau đó.

Có thể hiểu nhiều thứ: từ ngôn ngữ đến biểu tượng cảm xúc (Emojis)

Với sự hỗ trợ của Gemini thì SIMA 2 có thể hiểu vượt xa giới hạn của ngôn ngữ văn bản đơn thuần, cho phép người dùng giao tiếp với nó bằng nhiều cách thức đa dạng:

Chỉ dẫn đa phương thức: Nó có thể tuân theo các lệnh bằng văn bản, giọng nói, các bản phác thảo trên màn hình, và thậm chí là biểu tượng cảm xúc (emojis).
- Ví dụ: Bạn chỉ cần nhập tổ hợp 🪓🌲 (cây rìu và cây thông), và SIMA 2 sẽ hiểu đó là lệnh "đi chặt cây".

Đa ngôn ngữ: Tất nhiên SIMA 2 còn có khả năng hiểu và thực hiện các lệnh bằng nhiều ngôn ngữ tự nhiên khác nhau như tiếng Pháp, tiếng Trung, tiếng Đức và tiếng Tây Ban Nha.

Khái quát hóa: SIMA 2 có khả năng chuyển đổi các khái niệm trừu tượng đã học được từ một trò chơi sang một trò chơi hoàn toàn khác.

Ví dụ: Nếu nó học cách "khai thác" quặng trong một game sinh tồn, nó có thể áp dụng ngay khái niệm đó để thực hiện lệnh "khai thác" trong một game Minecraft. Hoặc cũng có thể mở rộng ra với các tựa game phổ biến như PUBG tự động loot đồ, hoặc LOL tự động farm quái kiếm kinh nghiệm lên cấp.

Ví dụ SIMA 2 sự khái quát — SIMA 2 Agent

Tự học hỏi không cần đến sự hướng dẫn của con người

Một trong những đóng góp nghiên cứu quan trọng nhất của SIMA 2 là cơ chế tự cải thiện.

Thay vì chỉ dựa vào dữ liệu người chơi cung cấp, sau giai đoạn đào tạo ban đầu, SIMA 2 có thể tự chuyển sang chế độ học hỏi thông qua thử và sai (trial-and-error).

Quá trình tự học: Một mô hình Gemini riêng biệt sẽ tạo ra các nhiệm vụ mới cho SIMA 2 trong môi trường ảo, và một mô hình đánh giá (reward model) sẽ chấm điểm hiệu suất của nó.
Kết quả: Những trải nghiệm của chính nó, mà dân gian hay gọi là "Mỡ nó rán nó" sẽ được lưu trữ và dùng để huấn luyện các phiên bản SIMA 2 sau, giúp tác nhân tự nâng cao hiệu suất mà không cần thêm dữ liệu đầu vào, hoặc sự hỗ trợ từ con người.

Bộ phận DeepMind của Google đã kiểm tra SIMA 2 trong các thế giới 3D hoàn toàn mới, được tạo ra theo thủ tục bằng mô hình Genie 3 (mô hình tạo thế giới ảo tương tác từ văn bản hoặc hình ảnh). SIMA 2 đã thành công trong việc điều hướng, nhận diện vật thể (như ghế dài hay hoa hoặc cả máy bay), và thực hiện các hành động được yêu cầu trong những thế giới hoàn toàn xa lạ này.

Video DeepMind về SIMA 2

Tương lai không chỉ là game mà hướng đến AGI và robot

Mục tiêu của Google DeepMind không phải chỉ là tạo ra một Faker AI mới trong làng game mà họ xem các trò chơi điện tử là môi trường đủ sự an toàn và phức tạp để xây dựng và thử nghiệm sự thích nghi của AI.

Các kỹ năng cấp cao mà SIMA 2 học được trong môi trường ảo như điều hướng không gian, sử dụng công cụ và tự hợp tác để giải quyết vấn đề là những thành phần cơ bản cần thiết cho các ứng dụng robot và xe tự lái trong thế giới thực.

Giống như việc bạn cần hiểu “tủ lạnh” và "bát đũa" là gì và cách di chuyển trong nhà để lấy chúng, robot cũng cần học rất nhiều về điều này khi mà sư chính xác được đặt lên hàng đầu hiện nay những robot như vậy hoàn toàn do con người điều khiển vì vậy chắc chắn SIMA 2 sẽ tập trung vào việc học những hành vi cần độ chính xác cao này.

Vậy SIMA 2 chính là minh chứng cho việc các ông lớn như Google chắc chắn chưa thay đổi mục tiêu AGI của họ, từ đó chắc chắn tạo ra tương lai AI có thể tương tác và hỗ trợ chúng ta trong nhiều lĩnh vực hơn nữa.

Thảo luận (0)

Đăng nhập để tham gia thảo luận.

Chưa có bình luận nào. Hãy là người đầu tiên!

Các bài viết liên quan

Gemini đồng hành cùng Argentina và Messi tại World Cup 2026

Gemini đã thắng lớn theo đúng nghĩa đen ngay khi Messi lập cú hat-trick đầu tiên tại World Cup 2026, giúp Argentina đè bẹp Algeria với tỷ số 3-0 và cân bằng kỷ lục 16 bàn thắng của Miroslav Klose. Khoảnh khắc lịch sử này chính là bệ phóng hoàn hảo cho Gemini. Trước đó vào tháng 3/2026, Google và Liên đoàn bóng đá Argentina (AFA) đã đưa ra một quyết định táo bạo: thay vì chỉ in logo trên áo tập, họ ký hợp đồng để AI này tham gia hỗ trợ chiến thuật và đưa ra các quyết định chuyên môn. Đến nay, thương vụ đặt cược này đã chứng minh đó là một chiến lược hoàn toàn đúng đắn. Từ áo tập đến phòng họp chiến thuật Thỏa thuận giữa AFA và Google được công bố tại Times Square, New York, một địa điểm được chọn có chủ ý để gây chú ý với truyền thông toàn cầu. Logo Gemini xuất hiện trên toàn bộ trang phục tập luyện của đội tuyển nam, nữ lẫn các lứa trẻ Argentina, đứng ngang hàng với Adidas và American Express trong tầng tài trợ cao nhất của AFA. Nhưng phần thú vị không nằm ở chiếc áo. Theo thông tin từ Inside World Football, ban huấn luyện Argentina sẽ dùng Gemini cho ba việc cụ thể: phân tích chiến thuật, phòng ngừa chấn thương và hỗ trợ ra quyết định. Nói cách khác, Gemini có mặt trong những cuộc họp mà trước đây chỉ có Scaloni và các trợ lý của ông được ngồi. Google không tiết lộ cụ thể những công cụ Gemini nào được tích hợp vào quy trình làm việc của AFA. Điều duy nhất rõ ràng là họ đang dùng World Cup để đưa Gemini vào thực tế bóng đá chuyên nghiệp, và kết quả sẽ được chấm điểm công khai. Gemini làm gì trong phòng thay đồ? Argentina đến World Cup 2026 với tư cách nhà đương kim vô địch. Mọi quyết định của Scaloni, từ danh sách triệu tập đến lựa chọn đội hình, đều bị soi kỹ hơn bất kỳ đội nào khác, và đây cũng chính là lý do Argentina trở thành phòng thí nghiệm lý tưởng nhất mà Google từng có cho Gemini trong môi trường bóng đá chuyên nghiệp và đặc biệt là ở giải đấu lớn. Phân tích chiến thuật Gemini được dùng để xử lý dữ liệu trận đấu của cả Argentina lẫn đối thủ, bao gồm thống kê di chuyển, mẫu hình tấn công và điểm yếu phòng thủ. Thay vì ban huấn luyện phải ngồi xem lại hàng giờ video, AI tổng hợp và đưa ra các sơ đồ chiến thuật được tạo tự động điều này sẽ tiết kiệm đáng kể thời gian chuẩn bị trước mỗi trận. Phòng ngừa chấn thương Đây là bài toán mà mọi đội bóng lớn đều muốn giải, đặc biệt khi Messi và nhiều trụ cột đã ở độ tuổi cần quản lý tải lượng tập luyện cẩn thận. Gemini phân tích dữ liệu sinh học và lịch sử chấn thương để đưa ra cảnh báo sớm, giúp ban huấn luyện điều chỉnh cường độ tập trước khi vấn đề thực sự xảy ra. Đó là lý do vì sao vừa ghi hat-trick Scaloni đã quyết định thay Messi ra để đảm bảo thể lực và an toàn cho các trận đấu sau. AI trong phòng ngừa chấn thương tất nhiên không phải diều mới mẻ gì khi mà tại Premier League đã có Microsoft làm đối tác cho mục đích tương tự. Điểm khác biệt lần này là Gemini được tích hợp trực tiếp vào quy trình của một đội tuyển dự giải lớn, không chỉ ở cấp câu lạc bộ. Phía người hâm mộ: tạo ảnh Messi, theo dõi tỉ số không cần mở khóa màn hình Song song với việc hỗ trợ ban huấn luyện, Gemini cũng triển khai một loạt tính năng hướng đến người hâm mộ, và đây mới là phần mà hàng trăm triệu người thực sự chạm vào. Gemini cho phép tạo nội dung về cầu thủ luôn Người dùng có thể tạo ảnh, bài nhạc và nội dung kỹ thuật số gắn với các cầu thủ Argentina như Messi ngay trong ứng dụng Gemini. Tính năng này được thiết kế để đưa trải nghiệm World Cup đến gần hơn với những người không thể đến sân trực tiếp. Tỉ số thời gian thực và bản tin tự động Trên Google Search, tỉ số trận đấu được ghim lên màn hình khóa và cập nhật theo thời gian thực, có animation riêng cho bàn thắng và thẻ đỏ mà không cần mở khóa điện thoại. Với người dùng Gemini trả phí, tính năng Scheduled Actions cho phép thiết lập bản tin bóng đá tự động mỗi ngày, bao gồm tỉ số, tin tức và lịch thi đấu, được giao đúng giờ đã chọn mà không cần nhắc lại mỗi ngày. Hạ tầng phục vụ ngày thi đấu Google cập nhật Street View tại 16 sân vận động chủ nhà và tối ưu hóa lộ trình trên Waze cho ngày thi đấu. Waze còn hiển thị tỉ số trực tiếp khi xe dừng đèn đỏ, để người lái không cần cầm điện thoại trong lúc di chuyển. World Cup 2026 là phép thử thật sự cho AI trong thể thao Google không chỉ tài trợ cho Argentina. Gemini còn có mặt trên áo của Pháp, Morocco, Iraq, Thổ Nhĩ Kỳ và Mỹ, trong khi Pixel là điện thoại chính thức của đội Pháp với Gemini được dùng cho liên lạc nội bộ. Đây rõ ràng là chiến lược tổng thể của Google và không phải một hợp đồng đơn lẻ. Điều khiến World Cup 2026 trở nên đặc biệt là nó sẽ trả lời một câu hỏi mà không phòng lab nào làm được: người dùng thực sự dùng AI để làm gì khi có một giải đấu World Cup 2026 kéo dài 6 tuần với 104 trận? Các tính năng chạy trên sức hút ban đầu sẽ tắt dần sau vòng bảng. Những gì người dùng còn tiếp tục dùng đến tận trận chung kết mới là câu trả lời thật cho câu hỏi AI phù hợp ở đâu trong cuộc sống hàng ngày, và Google biết rõ điều đó. Giám đốc truyền thông Google khu vực Mỹ Latinh, Flor Sabatini, phát biểu rằng World Cup 2026 sẽ đánh dấu một trước và sau trong lịch sử bóng đá nhờ AI. Câu nói nghe có vẻ marketing, nhưng thực tế là lần đầu tiên một mô hình AI lớn được tích hợp vào chuẩn bị của đội đương kim vô địch, ngay giữa một giải đấu được xem nhiều nhất hành tinh. World Cup 2026 là bài kiểm tra thật của Gemini Điểm đáng chú ý nhất của toàn bộ câu chuyện này không phải logo Gemini trên áo Messi. Đó là việc Argentina tất nhiên vẫn là đội được kỳ vọng nhất và bị soi kỹ nhất, với áp lực bảo vệ chức vô địch vẫn đặt một phần quy trình chuẩn bị của mình vào AI. Nếu Argentina thành công, Gemini có một case study không thể mua bằng tiền quảng cáo. Nếu Argentina thất bại mà ban huấn luyện quy trách nhiệm một phần cho AI, câu chuyện sẽ đi theo chiều ngược lại hoàn toàn. Dù kết quả thế nào, đây là lần đầu tiên AI phải chịu trách nhiệm ở một sân khấu thực sự có giá trị, không phải benchmark, không phải demo, mà là World Cup. Với người dùng AI, điều đáng theo dõi không chỉ là Argentina có vô địch hay không, mà là xem liệu Gemini có thực sự thay đổi cách một đội bóng vận hành, hay chỉ là logo trên áo tập đẹp hơn mọi năm.

Nam•

17 thg 6, 2026

Đọc thêm

Tạo mini app miễn phí chỉ với vài cú click cùng Google AI Studio

Trí tuệ nhân tạo (AI) đang thay đổi hoàn toàn cách con người tạo ra ứng dụng (app). Giờ đây, bạn không cần là lập trình viên chuyên nghiệp chỉ cần một trợ lý AI thông minh, bạn đã có thể biến ý tưởng thành sản phẩm thật. Google AI Studio chính là minh chứng rõ nhất cho sự thay đổi đó. Nền tảng này cho phép bất kỳ ai, dù không biết lập trình, cũng có thể tạo ứng dụng theo ý mình. Với bản cập nhật mới nhất, việc làm app AI giờ đơn giản như trò chuyện tự nhiên với các mô tả ý tưởng bằng ngôn ngữ tự nhiên, phần còn lại để AI lo. Google AI Studio: Lập trình AI không cần biết code và tạo app Android dễ dàng Google AI Studio là một môi trường phát triển chạy trực tiếp trên trình duyệt, được tạo ra để đơn giản hóa tối đa quá trình tạo mẫu và xây dựng ứng dụng dựa trên các mô hình AI mạnh mẽ của Google. Đặc biệt, nền tảng này giờ đây đã hỗ trợ tạo trực tiếp các ứng dụng Android hoàn chỉnh, mở ra cơ hội cho bất kỳ ai muốn đưa sản phẩm của mình lên thiết bị di động mà không cần viết một dòng code nào. Nếu trước đây, Gemini chỉ được ví như “bộ não” thông minh của ứng dụng, thì giờ đây Google AI Studio đã giúp nó có thêm “tay chân” với khả năng kết nối trực tiếp tới các API và SDK trong hệ sinh thái Google (thông qua mục Supercharge your apps with AI). Nhờ đó, việc mở rộng tính năng trở nên cực kỳ dễ dàng, bạn có thể khiến ứng dụng hoạt động đúng như mong muốn mà không cần phải tự tay cấu hình API, SDK rườm rà như trước. Tất nhiên, với các API hoặc SDK của bên thứ ba, bạn vẫn cần nhập thủ công. Nhưng nhờ hệ sinh thái “khổng lồ” của Google — bao gồm Nano Bananas, Veo 3, Text-to-Speech, Google Search, và đặc biệt là Google Maps — gần như mọi nhu cầu cơ bản đều đã được đáp ứng. Mình đã thử nghiệm và có thể xác nhận rằng Google Maps hoạt động hoàn toàn ổn định cho mini app tại Việt Nam, ví dụ như ứng dụng tìm đường hay xem giao thông theo thời gian thực. Còn khi dùng dữ liệu từ Google Search, kết quả trả về quá “chất lượng” — không cần phụ thuộc vào các công cụ cào dữ liệu (scraping) khác nữa. Điểm cộng lớn tiếp theo Google AI Studio thì nó hiện hoàn toàn miễn phí để trải nghiệm. Mình đã dùng thử và chưa mất bất kỳ khoản phí nào với lượng credit miễn phí mà Google cung cấp khá hào phóng, đủ để thoải mái thử sức với Gemini 3, Nano Banana Pro, Veo 3.1 và nhiều công cụ khác cho mục đích cá nhân. Hướng Dẫn Từng Bước Tạo Mini App AI Quá trình tạo ứng dụng trên Google AI Studio rất đơn giản, chỉ cần thực hiện theo các bước sau: Bước 1: Truy cập và Thiết lập Truy cập: Bạn truy cập vào trang công cụ Google AI Studio. Đăng nhập: Đăng nhập bằng tài khoản Google của bạn. Bắt đầu xây dựng: Vào tab “Build” (Xây dựng). Tại đây khi chọn vào tab Start, bạn có thể chọn mô hình AI (mặc định là Gemini 3.5 Flash) và bạn cũng có thể chọn ngôn ngữ lập trình ở đây là React hoặc Angular hoặc Android tùy bạn thích nếu không chọn thì AI sẽ mặc định là React. Bước 2: Lên ý tưởng cho ứng dụng Nếu bạn vẫn chưa nghĩ ra ý tưởng cụ thể, đừng lo hãy ghé vào App Gallery để xem qua những ứng dụng mẫu mà Google hoặc cộng đồng người dùng đã tạo. Đây là cách nhanh nhất để bạn lấy cảm hứng và hiểu rõ hơn về những gì có thể làm được. Còn nếu bạn “lười” hơn một chút, thì chỉ cần nhấn vào nút I’m feeling lucky trong tab Start. Ngay lập tức, Google AI Studio sẽ gợi ý cho bạn những ý tưởng thú vị, kèm theo ví dụ về cách tích hợp các API, SDK (trong mục Supercharge your apps with AI) và những prompt mà AI sử dụng. Cách này vừa tiết kiệm thời gian, vừa giúp bạn học được cách AI tư duy khi tạo ứng dụng. Nếu bạn đã có ý tưởng rõ ràng thì đến phần tiếp thôi nào. Bước 3: Viết yêu cầu (Prompt) cụ thể Nếu bạn chưa có một prompt chi tiết với đầy đủ yêu cầu về chức năng, ngôn ngữ hay giao diện như các mẫu trong nút I’m feeling lucky, cũng không sao cả. Bạn hoàn toàn có thể tạo ứng dụng chỉ với một câu đơn giản, ví dụ: “Tạo cho tôi ứng dụng ghép ảnh.” Lúc này, AI sẽ tự động quyết định mọi thứ và thực hiện các bước còn lại cho bạn. Tuy nhiên, việc mô tả càng chi tiết thì kết quả sẽ càng sát ý tưởng, giúp giảm thời gian chỉnh sửa. Nếu có thể, bạn nên cung cấp hình ảnh tham chiếu hoặc bản phác thảo từ các công cụ như Figma hay Canva, vì AI có thể hiểu và tạo giao diện gần như chính xác theo mẫu đó. Đừng quên thêm các tính năng bổ trợ trong mục Supercharge your apps with AI để AI tự kết nối các API hoặc SDK cần thiết, hoặc thậm chí bật chế độ suy luận thông minh cho ứng dụng. Ví dụ, một prompt chi tiết có thể như sau, các bạn có thể tham khảo “Tạo một AI Web App cho phép người dùng: Tải lên 2 ảnh (1 & 2) → Ứng dụng sẽ ghép thành 1 ảnh tổng hợp. Hỗ trợ nhiều tỉ lệ ảnh: 1:1, 16:9, 4:3, 3:2. Có xem trước ảnh, nút tải xuống (Download). Lưu lịch sử tạo ảnh (gồm ảnh kết quả, prompt và thời gian).” Sau khi hoàn thiện prompt, chỉ cần bấm Build và chờ vài giây để xem kết quả. Bước 4: AI tự động thực hiện các bước Quá trình xây dựng: AI Studio sẽ chạy chương trình, qua các giai đoạn như Xác định phạm vi giao diện (Defining the UI Scope). Phát triển ứng dụng React (Developing the React App). Lên kế hoạch cấu trúc ứng dụng (Planning the app structure). Tích hợp Gemini API (Integrating Gemini API). Tự động phát hiện và sửa lỗi (Auto fix error). Xem trước và sửa ứng dụng bằng hội thoại: Giao diện của mini app sẽ hiển thị bản xem trước (preview) ngay trong trình duyệt, giúp bạn thấy ngay ứng dụng hoạt động như thế nào. Với dân lập trình (dev), bạn có thể chỉnh sửa trực tiếp trong phần code. Nhưng nếu bạn không rành kỹ thuật, thì cũng chẳng sao cả — chỉ cần trò chuyện với AI, bạn vẫn có thể yêu cầu thêm, bớt hoặc chỉnh sửa tính năng mà không cần đụng đến một dòng mã nào. Ví dụ, bạn có thể nói: “Thêm cho tôi ảnh 3 và ảnh 4 để ghép 4 ảnh thành 1” hoặc “Đổi giao diện sang nền tối.” Nếu bạn chưa thêm API hoặc SDK ở bước "Nâng cao ứng dụng với AI" trước đó, đừng lo. Chỉ cần một câu lệnh đơn giản, AI sẽ tự động tích hợp các API hoặc SDK cần thiết vào ứng dụng mini của bạn rất nhanh chóng và cực kỳ tiện lợi.. Bạn thậm chí có thể yêu cầu những tính năng nâng cao như: Tạo video từ ảnh bằng Veo 3, ứng dụng sẽ tự động kết nối với API của Veo. Thêm nút chuyển giọng nói thành văn bản để tăng tính tương tác cho app. Và điều thú vị nhất là: bạn có thể chỉnh sửa ứng dụng như đang dùng Canva hay Figma với nút Annotate app — nơi bạn có thể vẽ, thêm chữ, đổi màu... tất cả đều diễn ra tự nhiên và trực quan nhất có thể. Bước 5: Chạy thử và Triển khai Hành động Cách thực hiện Chạy thử trong trình duyệt Nhấn nút "Run" hoặc xem live preview. Chia sẻ app qua link Nhấn "Share" → Copy link. Tải về mã nguồn Nhấn "Download" (File ZIP chứa mã React + TypeScript). Triển khai lên cloud Nhấn "Deploy" → Google Cloud Run (cần tài khoản Google Cloud). Có thể phát triển app hoàn chỉnh với Google AI Studio không? Tất nhiên, với mục đích cá nhân hoặc thử nghiệm ý tưởng nhanh, Google AI Studio là lựa chọn tuyệt vời vừa dễ dùng, vừa có chi phí gần như bằng 0. Tuy nhiên, nếu bạn muốn xây dựng một ứng dụng hoàn chỉnh (full-stack) với phần backend, UX, UI... mà vẫn không biết lập trình, thì nên cân nhắc các nền tảng khác phù hợp hơn. So sánh với Google Antigravity IDE Trong khi Google Antigravity là một IDE tập trung vào hỗ trợ lập trình viên (pro-dev) viết code nhanh hơn thông qua các agent tự động làm việc bất đồng bộ trong nền, thì Google AI Studio lại hướng tới đối tượng người dùng không chuyên (no-code/low-code). Với AI Studio, bạn không cần cài đặt phần mềm hay biết về cấu hình môi trường, mọi thứ diễn ra trực quan thông qua mô tả ngôn ngữ tự nhiên ngay trên trình duyệt. Ngược lại, Antigravity mang lại khả năng kiểm soát sâu hơn vào mã nguồn, hỗ trợ đa mô hình (Claude, GPT) và phù hợp cho các dự án phức tạp cần refactor toàn bộ codebase sẵn có. Mục đích Công cụ được đề xuất Sử dụng Cá nhân, Tạo mẫu nhanh (Prototyping), Thử nghiệm ý tưởng Google AI Studio Phát triển ứng dụng thương mại, Sản phẩm full-stack, Cần khả năng mở rộng Google Firebase, Lovable, Bolt, Replit, Antigravity Google AI Studio không phải lựa chọn tối ưu để phát triển sản phẩm ở quy mô lớn hay cần bảo mật cao. Thay vào đó, bạn có thể tải mã nguồn (code) từ AI Studio rồi tải lên hoặc có thể sysn trực tiếp qua Github để tiếp tục triển khai tiếp trên những nền tảng khác như Firebase Studio (trong hệ sinh thái Google), Lovable, Replit, hoặc Bolt, Microsoft 365. Các nền tảng này giúp bạn hoàn thiện ứng dụng hơn, với các tính năng back-end mạnh mẽ đồng thời vẫn tận dụng được sức mạnh của AI từ Google AI Studio.

Nam•

24 thg 5, 2026

Đọc thêm

Google I/O 2026: Flow được nâng cấp mạnh mẽ với Gemini Omni

Google không chỉ thêm một mô hình mới vào Flow. Tại Google I/O 2026, công ty đang biến Flow thành một studio sáng tạo AI có tác nhân, công cụ tùy biến, chỉnh sửa video hội thoại và cả ứng dụng di động. Với người làm video, đây là tín hiệu rất rõ rằng cuộc đua không còn nằm ở việc tạo clip đẹp trong một lần prompt, mà nằm ở khả năng sửa, lặp lại và hoàn thiện ý tưởng như một quy trình sản xuất thật. Gemini Omni biến Flow thành studio dựng video hội thoại Theo công bố của Google ngày 19 tháng 5 năm 2026, Flow được nâng cấp với Gemini Omni, trong đó Omni Flash là mô hình đầu tiên được đưa vào trải nghiệm này. Google mô tả Omni Flash như một mô hình có thể tạo nội dung từ nhiều loại đầu vào, bắt đầu với video, đồng thời kết hợp trí thông minh của Gemini với các mô hình media tạo sinh của Google. Điểm dễ hiểu nhất là bạn có thể xem Omni Flash như Nano Banana dành cho video. Nếu Nano Banana giúp chỉnh sửa ảnh trở nên tự nhiên hơn, Omni Flash đưa cách làm đó sang video, nơi người dùng có thể dùng cảm hứng ngoài đời, nội dung có sẵn và lời nhắc hội thoại để tiếp tục tinh chỉnh. Điều quan trọng là Google nói Omni Flash cải thiện sự nhất quán của nhân vật, nghĩa là nhận dạng và giọng nói có thể được giữ xuyên suốt nhiều cảnh. Flow Agent và Tools đưa AI vào cả quy trình sáng tạo Nâng cấp đáng chú ý thứ hai là Google Flow Agent. Thay vì chỉ nhận prompt rồi trả về kết quả, agent này được thiết kế như một cộng sự sáng tạo có thể lên kế hoạch, suy luận qua nhiệm vụ phức tạp và hỗ trợ người dùng ở nhiều giai đoạn khác nhau. Google đưa ví dụ agent có thể góp ý thoại cho một cảnh cụ thể hoặc đề xuất hướng phát triển cốt truyện. Khi dự án đi sâu hơn, Flow Agent có thể tạo nhiều biến thể cùng lúc để người dùng có thêm lựa chọn, đồng thời hỗ trợ batch edit để các thay đổi được áp dụng trên nhiều asset. Sau khi có đủ tư liệu, agent còn có thể sắp xếp chúng thành collection và đổi tên asset theo cách dễ hiểu hơn. Tính năng này hiện khả dụng cho toàn bộ người dùng Flow trên toàn cầu. Phần thú vị hơn nằm ở Google Flow Tools, nơi người dùng có thể tạo công cụ và workflow riêng bằng ngôn ngữ tự nhiên. Nếu bạn muốn một bộ chỉnh ảnh riêng, một công cụ resize video hoặc shader tùy biến, Flow Tools cho phép mô tả nhu cầu thay vì phải tự viết code. Nói cách khác, khái niệm vibe coding đang đi vào môi trường sáng tạo nội dung, không chỉ nằm trong IDE của lập trình viên. Mọi người dùng Flow trên toàn cầu có thể dùng Tools có sẵn Người dùng Google AI có thể tạo và remix Tools Công cụ tự tạo có thể được chia sẻ để người khác remix lại Flow Music cũng được nâng cấp cho người làm nhạc Google Flow Music cũng nhận loạt tính năng mới, trong đó quan trọng nhất là khả năng chỉnh sửa bài hát theo từng đoạn. Người dùng có thể chọn một phần cụ thể trong bài để viết lại lời, dịch lời, thay đổi beat drop hoặc lấy mẫu một đoạn nhạc rồi phát triển nó theo hướng khác mà không làm ảnh hưởng toàn bộ track. Tính năng covers cho phép biến đổi phong cách của cả bài hát nhưng vẫn giữ giai điệu và cấu trúc gốc. Ví dụ, một bản nhạc có thể được chuyển sang phong cách lo fi study để dùng cho playlist học tập hoặc nội dung nền. Với người mới làm nhạc bằng AI, cách tiếp cận này dễ hiểu hơn nhiều so với việc phải tạo lại từ đầu sau mỗi lần muốn đổi màu sắc âm nhạc. Gemini Omni cũng xuất hiện trong Flow Music để hỗ trợ tạo music video. Người dùng có thể làm việc theo dạng hội thoại với agent, chỉ dẫn phong cách, chủ thể và cảnh quay sao cho khớp với câu chuyện và nhịp của bài nhạc. Tính năng này dành cho người dùng Google AI, và nó cho thấy Google muốn nối liền ba lớp sáng tạo: âm thanh, hình ảnh và dựng chuyện. Ứng dụng di động giúp Flow đi ra khỏi bàn làm việc Google cũng công bố app di động cho cả Flow và Flow Music. Phiên bản web vẫn là nơi có đầy đủ năng lực nhất, nhưng app di động giúp người dùng ghi lại ý tưởng, tạo thử hoặc chỉnh sửa nhanh khi không ngồi trước máy tính. Kết luận Điểm lớn nhất của lần nâng cấp này không nằm ở một tính năng đơn lẻ. Google đang ghép Gemini Omni, Flow Agent, Tools và Flow Music thành một chuỗi làm việc hoàn chỉnh hơn, từ lên ý tưởng, tạo asset, chỉnh sửa hàng loạt, tổ chức tài nguyên cho tới xuất bản nội dung âm nhạc và video. Nếu bạn đang làm video, âm nhạc hoặc nội dung ngắn, cách thử hợp lý nhất là bắt đầu từ một asset thật của mình rồi xem Omni Flash giữ được nhân vật, giọng nói và mạch chỉnh sửa qua nhiều lượt tốt đến đâu. Nếu nó làm được điều đó ổn định, Flow sẽ không còn là công cụ tạo video AI đơn thuần mà trở thành một môi trường sản xuất nội dung rất đáng theo dõi trong năm 2026.

Nam•

21 thg 5, 2026

Đọc thêm

Ba cách giao việc hiệu quả cho Antigravity

Nhận việc xong rồi ngồi nhìn màn hình cả tiếng không biết bắt đầu từ đâu đây là điều này xảy ra với người dùng Antigravity không kém gì người làm việc thông thường. Vấn đề không phải bạn kém hay lười mà là não bạn không sợ việc khó, nó sợ việc không rõ ràng và khi bạn giao cho AI một yêu cầu mơ hồ thì kết quả Antigravity tạo ra cũng sẽ mơ hồ không kém. Tại sao giao việc cho Antigravity mà vẫn ra kết quả tệ? Antigravity là agent thực sự vì nó có thể lên kế hoạch, viết code, chạy lệnh và tự kiểm tra kết quả. Nhưng đây chính xác là lý do khiến nhiều người thất vọng lần đầu dùng, họ bắt tay ngay giao cho Antigravity một việc cực lớn và mơ hồ, agent chạy 30 phút theo hướng sai quota tiêu hao hết mà kết quả không dùng được. Các nhà khoa học nhận thức gọi trạng thái đóng băng trước việc lớn là quá tải nhận thức - cognitive overload. Não không biết xử lý từ đâu nên chọn cách an toàn nhất là không làm gì cả và vòng lặp quen thuộc trông như thế này: Não sợ làm sai → đóng băng Không bắt đầu được → hạn chót đến gần Càng sợ hơn → lại đóng băng tiếp Với Antigravity, quá tải nhận thức của người dùng trực tiếp tạo ra prompt tệ, và prompt tệ tạo ra agent chạy sai hướng tất nhiên vòng lặp này tốn token và thời gian hơn bất kỳ lỗi kỹ thuật nào. Có ba cách tiếp cận để phá vỡ vòng lặp đó, tùy vào mức độ bạn đã hiểu yêu cầu và đã thiết lập quy trình đến đâu. Ba cách tiếp cận việc hiệu quả với Antigravity Cách 1: Tải source code của người đã có kinh nghiệm Đây là cách nhanh nhất để bắt đầu mà không mất thời gian thiết lập từ đầu, đặc biệt phù hợp khi bạn chưa biết quy trình của mình nên trông như thế nào. Antigravity hoạt động tốt nhất khi có đủ ngữ cảnh về dự án dó là khi nó có thể nhìn thấy các rules, workflow, skills và thư mục bộ nhớ ghi lại kiến thức cũ. Thay vì tự xây dựng tất cả, bạn sao chép source code của người đã thiết lập đầy đủ, tải về và để agent đọc toàn bộ cấu hình có sẵn và điều tất nhiên là phải được người đó đồng ý hoặc đã public . Lưu ý: Rất nhiều người đã tận dụng điều này để phát tán mã độc vậy nên chỉ cài những source code từ chính thức từ Anthropic, Google, xAI, OpenAI,... hay những người có uy tín. Khi bạn sao chép kho code của người đã thiết lập đầy đủ, tải về và để agent đọc toàn bộ cấu hình có sẵn, bạn nhận được hai lợi ích cùng lúc: Agent hiểu ngay phong cách viết skills, workflow, nền tảng kỹ thuật và các rules của dự án từ ngày đầu mà không cần bạn giải thích lại. Bạn học được cách người có kinh nghiệm thiết lập quy trình — từ cách tổ chức thư mục bộ nhớ đến cách viết quy tắc cho agent mà không cần tự mày mò từ đầu. Tuy nhiên khi bạn không hiểu các ý đồ của người viết thì hoàn toàn không thể sử dụng hết chức năng của source code này giống như một mặc một chiếc áo quá rộng vậy. Cách 2: Tự giải quyết từng bước nhỏ trước khi giao việc lớn Đây là cách tiết kiệm hạn mức nhất và cũng là bài học mình học được sau nhiều lần lãng phí vì giao việc quá to ngay từ đầu. Bộ khung 4C — Làm rõ (Clarify), Tách nhỏ (Chunk), Tham khảo (Consult), Cam kết (Commit) vốn dùng để giải quyết việc của con người, nhưng áp dụng vào Antigravity lại cực kỳ hiệu quả vì lý do đơn giản: bạn càng rõ ràng trước khi giao việc, agent càng ít phải đoán. Bước làm rõ: Trước khi gõ bất cứ thứ gì vào Antigravity, hãy tự trả lời 4 câu hỏi sau: Kết quả cuối cùng trông như thế nào? Ai sẽ dùng cái này? Hạn chót thật sự là khi nào? Thế nào là hoàn thành tốt việc này? Năm phút ngồi trả lời sẽ thay đổi hoàn toàn chất lượng câu lệnh. Thay vì "xây cho mình một hệ thống đăng nhập", bạn sẽ viết được "xây hệ thống đăng nhập bằng Google OAuth cho ứng dụng Next.js, lưu phiên làm việc vào Firestore, chuyển hướng về trang chính sau khi đăng nhập thành công, chạy thử trên máy và chụp ảnh màn hình để mình xem". Bước tách nhỏ: Dựa trên hiệu ứng Zeigarnik một khi bạn bắt đầu dù chỉ một bước nhỏ, não tự động muốn hoàn thành những bước tiếp theo. Hãy hỏi agent "chia task thành các bước nhỏ nhất để bắt đầu ?" và đi qua từng bước một. Dành khoảng thời gian nhất định để tìm hiểu cấu trúc, kiểm tra xem agent hiểu đúng yêu cầu chưa trước khi để nó chạy việc lớn. Nhưng hãy nhớ là chỉ giành một khoảng thời gian nhất định thôi nhé vì chỉ khi thực hiện thì nhiều vấn đề mới thực sự lộ ra chúng ta mới tìm ra cách giải quyết. Ở bước này chúng ta có thể sử dụng luôn chế độ Fast Mode cho agent thực hiện luôn mà không cần phải tạo khung sườn hay suy nghĩ sâu hoặc thậm chí nếu không có gì đặc biệt thì Gemini Flash hoàn toàn có thể đảm nhiệm tốt phần này cực kì tiết kiệm token cho Gemini Pro và Claude Opus. Bước tham khảo: Đừng tự làm khó bản thân khi đã có người đi trước. Tương tự như cách 1 tải mã nguồn người khác về dùng, bước này là chủ động tìm và đọc cách họ tiếp cận vấn đề xem họ chia việc ra sao, viết câu lệnh như thế nào, thiết lập quy trình ra sao rồi chắt lọc những phương pháp phù hợp để áp dụng vào việc của mình. Bạn không cần sao chép nguyên xi, chỉ cần học từ cấu trúc tư duy của họ. Điều này đặc biệt có giá trị với những loại việc bạn chưa từng giao cho agent bao giờ vì người đã làm trước thường đã tìm ra cả những điểm dễ đi sai mà bạn chưa biết. Bước cam kết: Thay vì cố lên kế hoạch hoàn hảo cho toàn bộ việc trước khi bắt đầu hãy chỉ cam kết 10 đến 15 phút đầu tiên để tìm hiểu. Hỏi agent một câu nhỏ, xem nó phản hồi thế nào và lúc nào cũng thêm câu prompt “Nếu vấn đề không rõ hoàn toàn có thể hỏi lại không được tự ý quyết định”. Chắc chắn sẽ có những thiếu sót nhưng chúng ta sẽ cảm thấy được chúng ta đã đi được một quãng đường xa với Antigravity với task thay vì ngồi viết prompt hoàn hảo hàng giờ mà chưa làm được gì chắc chắn sẽ rất chán. Cách 3: Giao việc lớn ngay khi đã có quy trình thiết lập sẵn Cách này chỉ hoạt động khi bạn đã qua hai cách trên — đã có quy trình rõ ràng, bộ nhớ ngữ cảnh skills, và agent đã quen với các rules, workflow. Đây có thể coi là bước cam kết trong bộ khung 4C: thay vì lo lắng về toàn bộ việc, bạn cần hướng agent vào một kết quả cụ thể và để agent tự xử lý phần còn lại. Lúc này, chế độ Plan Mode là lựa chọn tốt hơn chế độ Fast Mode vì agent phải tạo kế hoạch thực hiện chi tiết trước khi thực hiện task, từ đó bạn có thể xem lại kế hoạch đó để lại ghi chú nếu cần điều chỉnh rồi mới để agent chạy. Cách này kết hợp tốc độ của agent với tầm nhìn chiến lược của bạn vì quy trình đã có sẵn nên bước làm rõ nên được tích hợp vào các rules, workflow, skills để agent không cần bạn giải thích lại ngữ cảnh mỗi lần. Đặc biệt đây là cách cực kì ưa thích đối với các Pro khi mà họ dùng Claude để lên kế hoạch cực xịn rồi sau đó họ đưa vào cho GLM để thực thi taks để tiết kiệm token. Chúng ta nên chọn cách nào cho công việc của chúng ta Ba cách này sử dụng trong Antigravity không loại trừ nhau mà theo thứ tự từ ít đến nhiều ngữ cảnh: Việc mơ hồ, chưa biết bắt đầu từ đâu: Sao chép source code người khác hoặc dùng bộ khung 4C để làm rõ trước. Việc đã hiểu nhưng lớn và phức tạp: Đi qua từng bước nhỏ, dùng Flash cho bước đơn giản và dành Pro cho bước cần suy nghĩ sâu. Việc đã có quy trình rõ ràng: Giao thẳng với chế độ Plan Mode, để agent tự xử lý trong khi bạn làm việc khác. Điểm chung của cả ba cách là bạn phải làm một việc trước khi mở Antigravity: suy nghĩ. Không phải suy nghĩ dài — chỉ cần 5 đến 10 phút ngồi làm rõ yêu cầu trước khi giao cho agent. Khoảng thời gian đó tiết kiệm nhiều hạn mức hơn bất kỳ kỹ thuật tối ưu prompt nào khác.

Nam•

3 thg 4, 2026

Đọc thêm