Ba loại token cần theo dõi
Input token là context coding agent gửi lên model. Cached input là phần prompt lặp lại được nhà cung cấp phục vụ từ cache. Output token là phần model sinh ra, thường biến động theo độ dài câu trả lời và số vòng tool call.
Một phép tính thực tế cần tách ba loại này thay vì nhân số request với một giá trung bình. Coding agent đọc nhiều file có thể tạo input lớn; một tác vụ sửa code dài lại tạo output lớn.
Công thức ước tính đơn giản
Chi phí xấp xỉ bằng input token nhân đơn giá input, cộng cached input token nhân đơn giá cache, cộng output token nhân đơn giá output. Mọi đơn giá cần cùng đơn vị, thường là USD trên 1 triệu token.
- Đo trên volume giống nhau khi so sánh hai model.
- Tách ngày thường và ngày chạy batch lớn.
- Đối chiếu với usage ledger sau khi chạy thật.
Dùng calculator trước khi mua gói
STEYG Code cung cấp calculator công khai để nhập token và tần suất, sau đó so sánh chi phí theo catalog model hiện hành. Công cụ này phù hợp để tạo baseline trước khi bật coding agent cho cả team.
Khi đã chạy thật, usage endpoint cho biết token, model và chi phí theo ngày. Dùng số đo thật để điều chỉnh model mặc định và ngân sách, không dùng traffic giả định làm cam kết.