Token trong AI là gì và cách tính chi phí khi gọi API model
Chị Ngân, phụ trách vận hành một startup edtech nhỏ, có tháng nhìn hoá đơn API AI tăng gấp ba lần so với tháng trước mà không ai trong đội giải thích nổi vì sao, cho đến khi ngồi soát lại mới phát hiện đội phát triển vừa thêm tính năng cho AI đọc luôn toàn bộ lịch sử chat của học viên trước khi trả lời mỗi câu hỏi mới — một thay đổi nhỏ trên code nhưng lại nhân số token phải trả tiền lên gấp nhiều lần mà không ai lường trước.
Câu chuyện của chị Ngân là lời nhắc rất thật: muốn dự toán được chi phí AI trước khi triển khai, bạn phải hiểu token được tính ra sao chứ không thể chỉ nhìn vào giá "mỗi triệu token" trên trang chủ rồi đoán mò. Bài này sẽ giúp bạn hiểu token là gì, cách đếm cho văn bản tiếng Việt, phân biệt token đầu vào và đầu ra, và một công thức đơn giản để ước tính chi phí theo đúng lưu lượng thật của công ty mình.
Token là gì và vì sao không phải là "một từ"
Token là đơn vị nhỏ nhất mà AI model dùng để đọc và sinh ra văn bản — nhưng khác với suy nghĩ thông thường, một token không nhất thiết bằng một từ. Với tiếng Anh, một từ ngắn thường gói gọn trong một token, còn từ dài có thể bị tách thành vài token nhỏ hơn. Với tiếng Việt có dấu, tình hình phức tạp hơn nhiều vì bộ ký tự Unicode có dấu thường khiến một từ bị tách thành nhiều token hơn so với từ tiếng Anh tương đương cùng độ dài — trên thực tế, cùng một đoạn văn bản, bản tiếng Việt thường tốn nhiều token hơn bản tiếng Anh dịch nghĩa từ 1,5 đến 2 lần tùy model. Đây là lý do vì sao doanh nghiệp Việt Nam thường thấy chi phí AI cao hơn kỳ vọng ban đầu nếu chỉ tính theo ước lượng dựa trên tài liệu tiếng Anh.
Token đầu vào và token đầu ra khác nhau ở đâu
Mọi lượt gọi API đều phát sinh hai loại token cần trả tiền riêng biệt: token đầu vào — tức toàn bộ nội dung bạn gửi lên gồm câu hỏi, tài liệu đính kèm và lịch sử trò chuyện trước đó — và token đầu ra, tức phần văn bản model trả lời lại cho bạn. Gần như mọi nhà cung cấp lớn hiện nay đều tính giá token đầu ra cao hơn hẳn token đầu vào, có khi gấp năm lần, vì phần sinh văn bản tốn nhiều tài nguyên tính toán hơn phần đọc hiểu. Điều này có nghĩa nếu công việc của bạn cần AI trả lời dài — như soạn thảo báo cáo hay viết nội dung — chi phí sẽ tăng nhanh hơn nhiều so với công việc chỉ cần AI đọc và phân loại ngắn gọn.
Một điểm dễ bị bỏ sót là lịch sử trò chuyện: mỗi lượt hỏi tiếp theo trong cùng một phiên thường phải gửi lại toàn bộ đoạn hội thoại trước đó như một phần token đầu vào, nên một cuộc trò chuyện càng kéo dài, chi phí mỗi lượt hỏi tiếp theo càng tăng dần chứ không giữ nguyên như lượt đầu tiên — đúng như trường hợp của chị Ngân khi hệ thống tự động nạp lại cả lịch sử chat học viên vào mỗi câu hỏi mới.
Công thức ước tính chi phí theo lưu lượng thật
Để không phải đoán mò như nhiều đội kỹ thuật vẫn làm, bạn có thể ước tính chi phí hằng tháng theo ba bước: trước tiên ước lượng số lượt gọi API trung bình mỗi ngày dựa trên số người dùng thật hoặc số tác vụ tự động hoá; tiếp theo ước lượng số token trung bình mỗi lượt gọi, bao gồm cả phần lịch sử hội thoại nếu có; cuối cùng nhân số token đó với đơn giá công bố của model đang dùng rồi cộng dồn theo tháng. Với văn bản tiếng Việt, bạn nên nhân thêm hệ số khoảng 1,5 lần vào số token ước tính ban đầu để tránh dự toán thấp hơn thực tế.
- Đo thử trên mẫu thật — chạy thử một trăm lượt gọi thực tế và ghi lại số token tiêu thụ để có con số chính xác thay vì ước lượng cảm tính từ đầu.
- Tính riêng token đầu vào và đầu ra — vì đơn giá chênh lệch lớn, gộp chung hai loại sẽ khiến bảng dự toán sai lệch đáng kể.
- Cộng thêm khoản phụ — như phí xử lý ảnh, âm thanh hay bộ nhớ đệm ngữ cảnh nếu tính năng của bạn có dùng đến, vì đây là những khoản rất dễ bị quên khi lập ngân sách…
Đặc biệt, nhiều nhà cung cấp hiện có cơ chế bộ nhớ đệm (prompt caching) cho phép tính giá rẻ hơn đáng kể với phần nội dung lặp lại giữa các lượt gọi — như một đoạn hướng dẫn hệ thống cố định hoặc tài liệu tham chiếu không đổi — nên nếu ứng dụng của bạn gọi API nhiều lần với cùng một phần ngữ cảnh cố định, việc tận dụng đúng cơ chế này có thể giúp giảm hẳn hoá đơn hằng tháng mà không cần đổi sang model rẻ hơn.
Đừng chỉ nhìn giá niêm yết trên trang chủ
Tuy giá "mỗi triệu token" nghe rất rõ ràng trên trang giới thiệu của các hãng, nhưng thực tế hoá đơn hằng tháng còn phụ thuộc vào nhiều khoản phụ khác mà trang giá chính không phải lúc nào cũng nêu bật ngay từ đầu, như phí xử lý ảnh tính theo từng ảnh, phí xử lý âm thanh tính theo giây, hay phụ phí khi context sử dụng vượt một ngưỡng nhất định. Bài Chi phí API model AI: các khoản dễ bị bỏ sót khi lập ngân sách đã tổng hợp đầy đủ các đầu mục này kèm mẫu bảng dự toán để bạn điền số thật vào ngay, tránh phải xin bổ sung ngân sách giữa chừng như nhiều doanh nghiệp từng gặp.
Ngoài ra, đơn giá token cũng khác nhau khá nhiều giữa các nhà cung cấp và giữa các phiên bản trong cùng một dòng model, nên nếu bạn đang cân nhắc chọn giữa Anthropic, OpenAI, Google DeepMind hay các lựa chọn khác, bài So sánh các nhà cung cấp model AI lớn: chọn theo nhu cầu nào sẽ giúp bạn đặt yếu tố giá cạnh các tiêu chí kinh doanh khác thay vì chỉ nhìn một con số đơn lẻ.
Nếu bạn vẫn đang ở bước đầu tìm hiểu và muốn có cái nhìn tổng thể trước khi đi sâu vào từng khoản chi phí, bài AI Model là gì và doanh nghiệp nên chọn model nào cho công việc là điểm khởi đầu phù hợp để đặt token và chi phí vào đúng bức tranh chọn model tổng thể.
Nắm được cách tính token rồi, việc trình bày ngân sách AI trước ban giám đốc cũng trở nên nhẹ nhàng hơn hẳn, vì bạn có con số thật để bảo vệ thay vì phải chống chế bằng cảm tính — và đó chính là lúc một khoản đầu tư công nghệ được duyệt nhanh và tin tưởng hơn rất nhiều, phải không nào?