BeelyWeb
06/09/2026

So sánh chi phí trên hiệu năng giữa các model AI phổ biến

Phong Nguyen
So sánh chi phí trên hiệu năng giữa các model AI phổ biến

Bảng xếp hạng benchmark nào cũng cho thấy model cao cấp nhất giành vị trí số một, nhưng không bảng xếp hạng nào cho bạn biết liệu tác vụ cụ thể của doanh nghiệp bạn có thực sự cần đến mức năng lực đó hay không, trong khi hoá đơn API mỗi tháng thì vẫn phải trả đúng theo mức giá cao cấp ấy.

Vì sao bảng xếp hạng chung không đủ để ra quyết định

Các bảng xếp hạng benchmark công khai thường đo model trên những bài toán chung như toán học, lập trình hay lý luận logic, trong khi tác vụ thực tế của doanh nghiệp bạn, ví dụ như trả lời câu hỏi khách hàng bằng tiếng Việt về sản phẩm cụ thể, lại có đặc thù hoàn toàn khác. Một model đứng đầu bảng xếp hạng chung có thể không phải lựa chọn tối ưu về chi phí trên hiệu năng cho đúng bài toán của bạn, trong khi một model xếp hạng thấp hơn nhưng giá rẻ hơn nhiều lần có khi lại đáp ứng đủ tốt.

Bài này sẽ giúp bạn có một bảng giá tham khảo cập nhật để bắt đầu, đồng thời quan trọng hơn là hướng dẫn cách tự dựng phép đo chi phí trên hiệu năng bằng chính dữ liệu của doanh nghiệp mình, thay vì chỉ nhìn vào giá niêm yết hay thứ hạng benchmark để quyết định. Nếu bạn chưa đọc qua bức tranh tổng quan về cách chọn model, bài AI Model là gì và doanh nghiệp nên chọn model nào cho công việc sẽ là điểm bắt đầu phù hợp trước khi đi sâu vào phần so sánh chi phí dưới đây.

Bảng giá tham khảo các model phổ biến theo triệu token

Bảng dưới đây tổng hợp mức giá công bố trên trang chính thức của một số nhà cung cấp lớn, cập nhật lần gần nhất vào đầu tháng 9/2026. Giá API thay đổi khá thường xuyên, có thể theo hướng tăng hoặc giảm tuỳ chiến lược từng nhà cung cấp, nên bạn cần đối chiếu lại bảng giá chính thức ngay trước khi lập ngân sách hoặc ký hợp đồng dài hạn, thay vì dùng số liệu trong bài như con số cố định.

Model (nhóm) Giá đầu vào / triệu token Giá đầu ra / triệu token Định vị
Model cao cấp nhất của OpenAI ~5 USD ~30 USD Tác vụ agentic phức tạp, nhiều bước
Model tầm trung của OpenAI ~2 USD ~12 USD Cân bằng chi phí và chất lượng cho khối lượng lớn
Model tiết kiệm của OpenAI ~0,2 USD ~1,2 USD Tác vụ đơn giản, tốc độ cao
Claude Opus (dòng cao cấp) ~5 USD ~25 USD Suy luận sâu, tác vụ phức tạp
Claude Sonnet (dòng cân bằng) ~2 USD ~10 USD Đa số tác vụ lập trình và văn bản hằng ngày
Claude Haiku (dòng tiết kiệm) ~1 USD ~5 USD Tác vụ nhanh, khối lượng lớn
Gemini Pro (dòng cao cấp) ~2 USD ~12 USD Ngữ cảnh dài, đa phương thức
Gemini Flash (dòng cân bằng) ~1,5 USD ~9 USD Tốc độ cao, chi phí trung bình
Gemini Flash-Lite (dòng tiết kiệm) ~0,3 USD ~2,5 USD Tác vụ đơn giản, tần suất cao

Nhìn vào bảng trên có thể thấy một khoảng cách giá rất lớn, có thể lên đến hàng chục lần, giữa dòng cao cấp và dòng tiết kiệm trong cùng một nhà cung cấp. Đây chính là lý do vì sao bước phân loại tác vụ theo độ khó, như đã bàn ở bài Model nhỏ hay model lớn: chọn đúng để không đốt tiền vô ích, quan trọng hơn nhiều so với việc chỉ nhìn giá niêm yết để chọn một model duy nhất cho toàn hệ thống.

Chi phí trên hiệu năng nghĩa là gì, không chỉ là giá rẻ

Chi phí trên hiệu năng không đơn giản là "model nào rẻ nhất", mà là tỷ lệ giữa số tiền phải trả và chất lượng kết quả thực tế nhận được cho đúng tác vụ của bạn. Một model giá 0,3 USD/triệu token nhưng phải gọi lại ba lần vì kết quả sai, hoặc cần thêm bước xử lý hậu kỳ tốn nhân lực để sửa lỗi, có thể tốn kém hơn nhiều so với một model giá 2 USD/triệu token nhưng cho kết quả đúng ngay lần đầu.

Vì vậy, khi so sánh chi phí trên hiệu năng, bạn cần tính đến cả tỷ lệ cần gọi lại, độ dài trung bình của câu trả lời (ảnh hưởng trực tiếp đến token đầu ra, vốn thường đắt hơn token đầu vào nhiều lần), và chi phí nhân sự xử lý lỗi nếu model trả về kết quả không chính xác.

Cách tự dựng bảng chi phí trên chất lượng bằng dữ liệu của bạn

Thay vì tin vào bảng xếp hạng chung, cách đáng tin cậy nhất là tự dựng phép đo trên chính dữ liệu và tác vụ của doanh nghiệp bạn, theo các bước sau.

  1. 1

    Chuẩn bị bộ test đại diện

    Lấy khoảng 50-100 ca thực tế đại diện cho tác vụ cần so sánh, kèm theo kết quả đúng đã được xác nhận bởi con người hoặc model đáng tin cậy nhất hiện có.

  2. 2

    Chạy cùng bộ test qua từng model ứng viên

    Ghi lại với mỗi model: tỷ lệ đúng, số token đầu vào/đầu ra trung bình mỗi lượt, và thời gian phản hồi trung bình.

  3. 3

    Tính chi phí thực tế cho 1.000 lượt gọi thành công

    Lấy chi phí trung bình mỗi lượt gọi (theo giá token) chia cho tỷ lệ đúng, ra được chi phí thực tế để có 1.000 kết quả đúng, thay vì chỉ tính chi phí trên 1.000 lượt gọi thô. Model rẻ nhưng tỷ lệ đúng thấp có thể tốn hơn model đắt nhưng chính xác cao ở phép tính này.

  4. 4

    Chạy lại định kỳ khi nhà cung cấp cập nhật model

    Các nhà cung cấp thường âm thầm cập nhật model phía sau cùng một tên gọi, nên chất lượng có thể thay đổi theo thời gian mà bạn không hay biết nếu không kiểm tra lại định kỳ.

Nếu muốn xây quy trình này thành một hệ thống lặp lại được thay vì làm thủ công mỗi lần, bạn có thể tham khảo bài Cách tự đánh giá model AI bằng bộ test của chính doanh nghiệp để biết cách dựng bộ test nội bộ và theo dõi chất lượng lâu dài.

Những yếu tố chi phí dễ bị quên khi chỉ nhìn giá token

  • Token ẩn trong chế độ suy luận: một số model cao cấp tính phí cả phần "suy nghĩ" nội bộ trước khi trả lời, khiến chi phí thực tế cao hơn số token bạn nhìn thấy trong câu trả lời cuối.
  • Chi phí lưu ngữ cảnh dài: gửi kèm lịch sử hội thoại hoặc tài liệu tham chiếu dài khiến token đầu vào tăng nhanh mỗi lượt gọi, dù giá mỗi token không đổi.
  • Chi phí retry khi lỗi hoặc giới hạn tốc độ: mỗi lần gọi lại do lỗi mạng hay bị giới hạn tốc độ cũng tính là một lượt gọi mất phí, cộng dồn âm thầm vào hoá đơn cuối tháng.

Để nắm đầy đủ các khoản phí dễ bị bỏ sót này khi lập ngân sách, bạn nên đọc thêm bài Chi phí API model AI: các khoản dễ bị bỏ sót khi lập ngân sách.

Ví dụ minh hoạ: ba tác vụ, ba lựa chọn khác nhau

Để thấy rõ vì sao không có một model "tốt nhất" chung cho mọi việc, hãy nhìn vào ba tác vụ phổ biến trong doanh nghiệp và cách áp dụng phép tính chi phí trên hiệu năng cho từng tác vụ đó.

Tác vụ Đặc điểm Nhóm model nên ưu tiên thử trước
Chatbot trả lời câu hỏi thường gặp Khối lượng rất lớn, câu hỏi lặp lại, ngữ cảnh ngắn, cần phản hồi nhanh Dòng tiết kiệm, có cơ chế leo thang lên dòng tầm trung khi không chắc chắn
Viết nháp nội dung marketing Khối lượng vừa phải, cần sự sáng tạo và văn phong tự nhiên, con người sẽ biên tập lại Dòng tầm trung, cân bằng giữa chất lượng văn bản và chi phí
Phân tích hợp đồng, đối chiếu điều khoản pháp lý Khối lượng thấp, sai sót có thể gây rủi ro pháp lý hoặc tài chính lớn Dòng cao cấp nhất, kèm con người rà soát lại trước khi dùng chính thức

Điểm chung của cả ba ví dụ là quyết định không dựa trên việc model nào "mạnh nhất" theo benchmark, mà dựa trên tỷ lệ giữa khối lượng công việc, mức độ rủi ro khi sai, và chi phí mỗi lượt gọi. Một doanh nghiệp thương mại điện tử xử lý hàng chục nghìn câu hỏi khách hàng mỗi ngày sẽ tiết kiệm được rất nhiều nếu chuyển tác vụ chatbot sang dòng tiết kiệm, trong khi phòng pháp chế của cùng công ty đó vẫn nên giữ dòng cao cấp cho việc rà soát hợp đồng dù khối lượng chỉ vài chục văn bản mỗi tháng.

Cũng cần lưu ý rằng ranh giới giữa các nhóm model không cố định mãi mãi. Một model tầm trung của năm nay có thể mạnh ngang model cao cấp của một năm trước, nên việc chạy lại bộ test định kỳ theo đúng dữ liệu của bạn, thay vì gắn cứng vào một model duy nhất, mới là cách giữ được chi phí trên hiệu năng tối ưu về lâu dài.

Gợi ý chọn theo nhu cầu, không theo bảng xếp hạng

Nếu bạn cần xử lý khối lượng lớn tác vụ đơn giản

Ưu tiên dòng model tiết kiệm của bất kỳ nhà cung cấp nào, miễn là đã kiểm thử tỷ lệ đúng đạt yêu cầu trên bộ test thực tế của bạn. Khoảng cách giá giữa dòng tiết kiệm và dòng cao cấp thường đủ lớn để việc kiểm thử kỹ trước khi chọn hoàn toàn xứng đáng với thời gian bỏ ra.

Nếu bạn cần cân bằng giữa chất lượng và chi phí cho khối lượng vừa phải

Dòng model tầm trung của các nhà cung cấp lớn thường là điểm cân bằng tốt, đủ mạnh cho phần lớn tác vụ văn bản và lập trình hằng ngày mà không phải trả mức giá cao cấp nhất.

Nếu tác vụ ảnh hưởng trực tiếp đến quyết định quan trọng

Đừng tiếc chi phí ở đây. Chọn model cao cấp nhất phù hợp với ngân sách, vì một quyết định sai do model yếu gây ra thường tốn kém hơn rất nhiều so với khoản chênh lệch giá giữa các dòng model.

Câu hỏi thường gặp

Model rẻ nhất trên thị trường có luôn là lựa chọn tệ không?

Không, ngược lại rất nhiều tác vụ đơn giản, lặp lại nhiều lần chạy hoàn toàn tốt trên model rẻ nhất. Vấn đề chỉ nảy sinh khi dùng model rẻ cho tác vụ vượt quá năng lực của nó mà không kiểm thử trước.

Nên so sánh bao nhiêu model cùng lúc là đủ?

Ba đến bốn model là hợp lý cho một vòng thử nghiệm: một model cao cấp làm mốc chất lượng, một hoặc hai model tầm trung, và một model tiết kiệm. So sánh nhiều hơn thường không tăng thêm giá trị quyết định mà chỉ tốn thêm thời gian kiểm thử.

Giá API có ổn định lâu dài không hay sẽ tiếp tục thay đổi?

Thị trường này vẫn đang cạnh tranh mạnh nên giá có thể thay đổi theo cả hai chiều tăng và giảm, đôi khi khá đột ngột khi có model mới ra mắt. Vì vậy bạn nên xây quy trình kiểm tra lại giá và chất lượng định kỳ, thay vì xem bảng giá tại một thời điểm là cố định mãi mãi.

Nếu bạn muốn được hỗ trợ dựng bảng chi phí trên hiệu năng cho đúng tác vụ và dữ liệu của doanh nghiệp mình thay vì phải tự mày mò, hãy để đội ngũ BeelyWeb giúp bạn so sánh công cụ phù hợp nhất với ngân sách và mục tiêu hiện tại.