Tiết kiệm token cho AI Agent nhờ Ponytail và Caveman

Tóm tắt nhanh
Trong cộng đồng AI mùa hè 2026, hai công cụ mã nguồn mở Ponytail và Caveman đang thu hút sự chú ý lớn nhờ giải quyết bài toán lãng phí token cho các AI Agent như Claude Code, Codex và Gemini CLI. Ponytail cắt giảm tới 54% số dòng code sinh ra thông qua thang tự vấn 7 nấc chống over-engineering. Trong khi đó, Caveman tấn công vào ngữ cảnh đọc (giảm 33.2% input token qua proxy) và phản hồi dông dài (giảm tới 65% output token), cùng tính năng Pixel Mode nén SKILL.md thành ảnh. Tuy nhiên, các con số quảng cáo cần được xem xét cẩn trọng vì đều được đo trên từng kịch bản cụ thể. Việc kết hợp cả hai công cụ hứa hẹn đem lại hiệu quả tối đa và duy trì ngữ cảnh sạch cho AI Agent.
Token hiện nay đang là vấn đề nóng luôn luôn được chú ý trong cộng đồng AI. Trong đó hai skill mã nguồn mở về vấn đề tiết kiệm token đang được cộng đồng lập trình AI bàn tán nhiều nhất mùa hè 2026: Ponytail giúp giảm tới 54% dòng code sinh ra, còn Caveman cắt gọn 65% token trong phản hồi của Agent. Cả hai cùng nhắm vào một nỗi đau quen thuộc của mọi người dùng AI Agent lập trình như Claude Code, Codex hay Gemini CLI, đó là chi phí token ngày càng phình to, nhưng lại giải quyết theo hai hướng hoàn toàn khác nhau: một bên cắt phần code thừa, một bên cắt phần lời thừa.
Bài toán lãng phí token trong kỷ nguyên AI Agent
Các AI Agent ngày nay không chỉ trả lời một câu hỏi đơn lẻ mà hoạt động theo chuỗi vòng lặp tự động (agentic loop): đọc file, phân tích dự án, viết code, chạy thử và kiểm tra lỗi. Trong quy trình đó, token phần lớn bị lãng phí qua ba kênh chính:
- Over-engineering (Viết thừa code): Thay vì dùng tính năng có sẵn của ngôn ngữ hoặc trình duyệt, agent thường tự cài thêm thư viện phụ thuộc (dependency) hoặc dựng nên những component phức tạp không cần thiết.
- Input Overhead (Đọc dư thừa): Nhật ký build, dữ liệu JSON, kết quả tìm kiếm và các file hướng dẫn (SKILL.md) ngốn hàng chục ngàn input token mỗi lần gửi yêu cầu lên nhà cung cấp API.
- Output Bloating (Nói dài dòng): Agent giải thích dông dài những khái niệm căn bản trước khi đưa ra câu trả lời cốt lõi.
Ponytail: biến AI Agent thành "senior dev lười biếng"
Dự án Ponytail của nhà phát triển Dietrich Gebert được thiết kế với triết lý: "Mã nguồn tốt nhất là mã nguồn bạn không bao giờ phải viết". Ponytail buộc AI Agent phải suy nghĩ như một lập trình viên senior lâu năm, người luôn luôn tìm giải pháp đơn giản và tốn ít công sức nhất.
Chuỗi câu hỏi tự vấn trước khi viết code
Trước khi đặt tay vào viết code, Ponytail bắt buộc Agent phải đi qua một chuỗi câu hỏi tự vấn:
- YAGNI: Tính năng này có thực sự cần thiết không? Nếu không, bỏ qua lập tức.
- Tái sử dụng: Đã có sẵn hàm hoặc component tương tự trong dự án chưa?
- Thư viện chuẩn: Thư viện chuẩn của ngôn ngữ có xử lý được không?
- Nền tảng gốc: Trình duyệt hoặc hệ điều hành đã hỗ trợ sẵn chưa? (Ví dụ: dùng thẻ
<input type="date">native thay vì cài thư viện Flatpickr nặng nề) - Dependency đã cài: Các gói thư viện đã có trong
package.jsoncó giải quyết được không? - One-liner: Có thể xử lý gọn trong 1 dòng code không?
- Chỉ khi các bước trên không đáp ứng, Agent mới tiếp tục viết đoạn code tối giản nhất vừa đủ hoạt động.
Kết quả benchmark có khác với thực tế không
Trong thử nghiệm với Claude Code (Haiku 4.5) trên mẫu dự án full-stack FastAPI + React, Ponytail giúp giảm 54% số dòng code mà vẫn giữ nguyên 100% độ an toàn của ứng dụng.
Caveman: một hệ sinh thái nén token, không chỉ một skill
Nếu Ponytail tập trung vào mã nguồn sinh ra, thì Caveman của Julius Brussee lại tấn công cả phần đầu vào lẫn đầu ra của Agent, với khẩu hiệu vui nhộn: "why use many token when few token do trick". Bản Caveman hiện tại không còn là một skill đơn lẻ mà là một bộ công cụ gồm nhiều lớp.
Caveman Proxy: nén dữ liệu đầu vào
Một proxy cục bộ được đặt giữa Agent và API provider, tự động định tuyến toàn bộ traffic đi qua. Proxy này nhận diện từng loại payload như JSON, log lỗi, git diff hay kết quả tìm kiếm, rồi nén theo cách giữ lại phần nội dung mà câu trả lời thực sự phụ thuộc vào, trong khi vẫn lưu bản sao trên ổ đĩa để khôi phục chính xác khi cần. Trong một benchmark 54 lượt chạy cố định trên Claude Code, cơ chế này dùng ít hơn 33.2% input token so với chạy trực tiếp, đồng thời vẫn vượt qua toàn bộ các bài kiểm tra đáp án chính xác.
Caveman Skill: nén ngôn ngữ phản hồi
Đây là phần giúp ngôn ngữ quay về thời người tiền sử nguyên bản: Agent bỏ qua các câu xã giao thừa thãi, đi thẳng vào vấn đề mà không làm biến đổi bất kỳ dòng lệnh hay mã nguồn nào. Phần code, lệnh và log lỗi vẫn được giữ nguyên byte-exact, chỉ phần lời giải thích bị nén lại.
Pixel Mode: chuyển file hướng dẫn skill thành ảnh
Các file SKILL.md dài dòng được chuyển đổi thành ảnh PNG khi cài skill mới, tận dụng khả năng đọc ảnh (vision) của các mô hình LLM hiện đại để giảm số token cần nạp. Đo trên chính skill Caveman, cách này giúp giảm kích thước từ khoảng 1.069 xuống còn 415 token ước tính, tương đương 61%.
Caveman Learn: tự chẩn đoán điểm nghẽn token
Lệnh caveman learn tự động đọc lịch sử làm việc của Agent trên máy (chạy cục bộ, không cần tài khoản), chấm điểm cách thiết lập hiện tại và chỉ ra chính xác những chỗ đang ngốn token nhất để người dùng khắc phục.
Con số cần lưu ý khi đọc marketing của Caveman
Có thể kết hợp Ponytail và Caveman trong cùng một phiên làm việc hay chung 1 project không
Ponytail và Caveman không hề dẫm chân nhau. Caveman chịu trách nhiệm giữ cho những gì Agent đọc (input) và nói (output) ngắn gọn nhất có thể, trong khi Ponytail đảm bảo những gì Agent viết (code) đạt độ tối giản cao nhất. Vì cơ chế không chồng lấn, chúng ta hoàn toàn có thể dùng song song cả hai trong cùng một phiên làm việc.
Chưa có benchmark độc lập nào đo mức tiết kiệm khi kết hợp cả hai cùng lúc, nhưng cộng theo lý thuyết các con số đã công bố riêng lẻ thì tổng token tiêu thụ mỗi phiên có thể giảm đáng kể, đủ để đáng thử nghiệm trên dự án thật của bạn.
Hướng dẫn tích hợp vào workflow lập trình hàng ngày
Cả Ponytail và Caveman đều hỗ trợ cài đặt nhanh cho các công cụ lập trình AI phổ biến như Claude Code, Codex, Gemini CLI, Cursor hay Windsurf.
Cài đặt Ponytail
Với Claude Code:
claude plugin marketplace add DietrichGebert/ponytail && claude plugin install ponytail@ponytail
Với các agent khác chưa hỗ trợ plugin marketplace, bạn có thể sao chép trực tiếp file rules từ repo GitHub vào thư mục dự án.
Cài đặt Caveman
Với Claude Code:
claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman
Với Gemini CLI:
gemini extensions install https://github.com/JuliusBrussee/caveman
Cài cho Cursor, Windsurf, Cline và các agent khác
Caveman hỗ trợ cài qua registry chung:
npx skills add JuliusBrussee/caveman -a <tên-agent>
Bạn sẽ chọn Ponytail, Caveman hay là cả hai?
Tối ưu token không chỉ là chuyện tiết kiệm chi phí, mà còn giúp AI Agent giữ ngữ cảnh sạch, tránh trôi thông tin khi làm việc dài hạn. Nhưng bài học lớn hơn từ cả hai skill này là đừng tin ngay con số phần trăm được quảng cáo, kể cả khi nó đến từ chính tác giả, vì mỗi con số thường chỉ đo một trường hợp cụ thể chứ không phải mức trung bình chung. Cách chắc chắn nhất vẫn là tự chạy benchmark trên codebase thật của bạn trước khi quyết định đưa Ponytail, Caveman, hay cả hai vào workflow hàng ngày.



