Cách tự đánh giá model AI bằng bộ test của chính doanh nghiệp
Phòng marketing khen model mới trả lời mượt hơn hẳn, phòng kỹ thuật lại phàn nàn nó hay bịa số liệu, còn phòng chăm sóc khách hàng thì im lặng vì chưa ai hỏi ý kiến họ — ba kết luận khác nhau cho cùng một model, chỉ vì không ai trong công ty dùng chung một bộ tiêu chí để đánh giá. Bài này giúp bạn dựng một bộ test nội bộ đơn giản, chấm điểm công bằng và theo dõi chất lượng model theo thời gian, để lần sau cả công ty tranh luận dựa trên số liệu chứ không phải cảm tính.
Vì sao benchmark công khai không đủ để bạn ra quyết định
Các bảng xếp hạng benchmark công khai rất hữu ích để có cái nhìn tổng quan về năng lực chung của một model, nhưng chúng được đo trên bộ câu hỏi chuẩn hoá, không phải trên đúng loại văn bản, đúng ngôn ngữ nghiệp vụ và đúng kiểu câu hỏi mà khách hàng của bạn thật sự gửi tới. Một model đứng đầu bảng xếp hạng suy luận toán học chưa chắc trả lời tốt câu hỏi về chính sách đổi trả hàng bằng tiếng Việt theo đúng giọng thương hiệu công ty bạn. Thực tế nhiều đội kỹ thuật đã từng chuyển sang model mới chỉ vì thấy điểm benchmark công khai cao hơn, để rồi phát hiện ra sau vài tuần vận hành rằng model đó lại kém hơn hẳn model cũ khi xử lý đúng loại câu hỏi khách hàng của họ hay hỏi nhất.
Đó là lý do vì sao bộ test nội bộ, dù nhỏ và thô sơ, vẫn có giá trị thực tế cao hơn nhiều so với việc chỉ nhìn điểm số benchmark chung. Bạn có thể tìm hiểu thêm cách đọc đúng các bảng benchmark công khai qua bài Đọc benchmark AI thế nào để không bị số liệu đẹp đánh lừa, coi đó là bước tham khảo ban đầu trước khi tự kiểm chứng trên dữ liệu của chính mình.
Dựng bộ test nội bộ từ chính dữ liệu của bạn
Bạn không cần một hệ thống phức tạp để bắt đầu, chỉ cần một tập hợp câu hỏi và tình huống thật, đại diện cho đúng công việc model sẽ đảm nhận.
-
1
Thu thập 30-50 tình huống thật từ dữ liệu vận hành
Lấy từ lịch sử hội thoại chăm sóc khách hàng, email thật, hoặc tài liệu nội bộ hay dùng — càng sát thực tế, kết quả đánh giá càng đáng tin.
-
2
Bao phủ cả tình huống dễ lẫn tình huống khó, mơ hồ
Đừng chỉ chọn câu hỏi rõ ràng dễ trả lời. Thêm vào những câu hỏi mơ hồ, thiếu thông tin hoặc dễ khiến model "bịa" để xem model xử lý ra sao khi không chắc chắn.
-
3
Viết trước câu trả lời mẫu hoặc tiêu chí đúng/sai
Với mỗi câu hỏi, xác định trước điều gì tính là câu trả lời đạt yêu cầu, để người chấm điểm không phải tự phán đoán theo cảm tính riêng mỗi lần.
-
4
Chạy cùng bộ câu hỏi qua từng model cần so sánh
Giữ nguyên câu hỏi, chỉ đổi model, để đảm bảo sự khác biệt trong kết quả đến từ chính model chứ không phải từ câu hỏi bị thay đổi giữa các lần chạy.
Chấm điểm mù để tránh thiên vị model quen thuộc
Một lỗi rất phổ biến là để người chấm điểm biết trước câu trả lời nào đến từ model nào, dẫn đến việc chấm thiên vị cho model quen dùng hoặc model có thương hiệu nổi tiếng hơn, dù chất lượng câu trả lời thực tế không chênh lệch nhiều. Cách khắc phục đơn giản là trộn ngẫu nhiên câu trả lời từ các model và ẩn tên nhà cung cấp trước khi đưa cho người chấm, chỉ đánh số thứ tự A, B, C.
Ngoài ra, nên để ít nhất hai người chấm độc lập trên cùng bộ câu hỏi, đặc biệt với những tiêu chí mang tính chủ quan như "giọng văn có đúng phong cách thương hiệu không". Khi hai người chấm cho kết quả lệch nhau nhiều, đó thường là dấu hiệu tiêu chí chấm điểm chưa đủ rõ ràng, cần viết lại cụ thể hơn trước khi chấm tiếp. Người chấm cũng nên đến từ nhiều phòng ban khác nhau chứ không chỉ đội kỹ thuật, vì người trực tiếp trò chuyện với khách hàng mỗi ngày thường nhận ra ngay những câu trả lời "đúng nhưng nghe sai" mà đội kỹ thuật khó phát hiện nếu chỉ nhìn vào tính chính xác thuần tuý.
Mẹo nhỏ
Với những tiêu chí có thể kiểm tra máy móc được, ví dụ định dạng đầu ra đúng cấu trúc hay có trích dẫn nguồn hay không, hãy để script tự động chấm phần đó thay vì tốn thời gian con người, chỉ dành công sức con người cho những tiêu chí thật sự cần đánh giá chất lượng và ngữ nghĩa.
Bốn nhóm tiêu chí nên có trong mọi bộ test
Nhiều đội khi mới bắt đầu chỉ chấm mỗi một tiêu chí duy nhất là "câu trả lời có đúng không", trong khi thực tế một model có thể trả lời đúng nội dung nhưng vẫn không dùng được vì sai giọng văn, quá chậm, hoặc vô tình để lộ thông tin nhạy cảm. Nên tách rõ bốn nhóm tiêu chí sau và chấm riêng từng nhóm thay vì gộp chung thành một điểm số duy nhất.
| Nhóm tiêu chí | Câu hỏi cần trả lời khi chấm |
|---|---|
| Độ chính xác | Thông tin đưa ra có đúng không, có tự bịa chi tiết nào không có trong dữ liệu nguồn không |
| Giọng văn và phong cách | Câu trả lời có đúng phong cách thương hiệu, đúng mức trang trọng cần thiết không |
| An toàn và tuân thủ | Có vô tình tiết lộ thông tin nội bộ, đưa lời khuyên sai lệch hoặc vượt quá phạm vi được phép không |
| Tốc độ và chi phí | Thời gian phản hồi và số token tiêu tốn có nằm trong ngưỡng chấp nhận được cho tác vụ này không |
Tách riêng bốn nhóm này giúp bạn nhìn ra ngay điểm mạnh yếu cụ thể của từng model thay vì một điểm số mơ hồ. Ví dụ một model có thể đạt điểm chính xác cao nhưng giọng văn quá máy móc so với phong cách thương hiệu, trong khi model khác trả lời tự nhiên hơn nhưng lại chậm hơn đáng kể — hai vấn đề này cần hai hướng xử lý hoàn toàn khác nhau, và bạn chỉ nhìn ra được nếu chấm điểm tách bạch ngay từ đầu.
Công cụ hỗ trợ: tự làm bằng tay hay dùng nền tảng có sẵn
Với bộ test dưới vài chục câu hỏi, một bảng tính đơn giản hoàn toàn đủ dùng để bắt đầu. Khi quy mô lớn hơn, chạy thường xuyên hoặc cần lưu lại lịch sử để so sánh theo thời gian, một số nền tảng đánh giá chuyên dụng sẽ giúp tiết kiệm công sức đáng kể.
| Công cụ | Đặc điểm chính | Phù hợp khi nào |
|---|---|---|
| Promptfoo | Mã nguồn mở, chạy bằng dòng lệnh, dễ tích hợp vào quy trình kiểm thử tự động | Đội kỹ thuật muốn kiểm soát toàn bộ, không phụ thuộc dịch vụ ngoài |
| Langfuse | Có bản mã nguồn mở tự lưu trữ và bản dịch vụ đám mây, kết hợp theo dõi log thực tế với chấm điểm | Cần vừa giám sát vận hành vừa đánh giá chất lượng trong cùng một nơi |
| LangSmith | Tích hợp chặt với hệ sinh thái LangChain, có bản dùng thử miễn phí giới hạn | Đội đã dùng LangChain trong hệ thống, muốn giảm công tích hợp |
| Braintrust | Tập trung vào quy trình đánh giá và so sánh phiên bản model một cách có hệ thống | Doanh nghiệp cần quy trình đánh giá bài bản cho nhiều đội cùng dùng chung |
Mức giá và điều kiện dùng bản tự lưu trữ của các công cụ này thay đổi khá thường xuyên, nên hãy kiểm tra trực tiếp trang giá chính thức của từng nền tảng trước khi quyết định, thay vì dựa vào con số cũ đọc được ở nơi khác. Với đa số doanh nghiệp vừa và nhỏ, bắt đầu bằng công cụ mã nguồn mở miễn phí như Promptfoo hoặc bản tự lưu trữ của Langfuse là đủ dùng trong giai đoạn đầu.
Theo dõi chất lượng khi nhà cung cấp âm thầm cập nhật model
Nhiều nhà cung cấp cập nhật phiên bản model đứng sau cùng một tên gọi mà không thông báo rộng rãi, khiến chất lượng đầu ra của hệ thống bạn thay đổi đột ngột dù bạn không sửa gì trong code. Đây là lý do bộ test nội bộ không nên chỉ chạy một lần rồi cất vào tủ, mà cần chạy lại định kỳ, ví dụ mỗi tháng hoặc mỗi khi nhận thấy chất lượng phản hồi có dấu hiệu bất thường.
Việc lưu lại điểm số theo thời gian cũng giúp bạn có bằng chứng cụ thể khi cần trao đổi với nhà cung cấp về chất lượng dịch vụ, thay vì chỉ nói cảm tính "model dạo này trả lời tệ hơn". Kết hợp bộ test này với việc giám sát log thực tế trong bài Giám sát và ghi log khi dùng model AI trong hệ thống thật sẽ cho bạn bức tranh đầy đủ cả về chất lượng lẫn độ ổn định vận hành.
Một thực tế khác cũng đáng lưu tâm là khi nhà cung cấp thông báo ngừng hỗ trợ một phiên bản model cũ và buộc bạn chuyển sang phiên bản mới, bộ test nội bộ chính là công cụ nhanh nhất để trả lời câu hỏi "chuyển model mới có ảnh hưởng gì đến chất lượng hệ thống không" trước khi công bố rộng rãi cho người dùng, thay vì phải chờ phản hồi tiêu cực từ khách hàng rồi mới phát hiện ra vấn đề.
Checklist dựng bộ đánh giá nội bộ
- Có ít nhất 30 tình huống thật lấy từ dữ liệu vận hành, bao phủ cả trường hợp dễ lẫn khó
- Có tiêu chí đúng/sai viết sẵn trước khi chấm, không chấm theo cảm tính tức thời
- Chấm điểm mù, ẩn tên model, có ít nhất hai người chấm độc lập
- Có lịch chạy lại định kỳ, không chỉ chạy một lần rồi bỏ quên
Một bộ test nội bộ dù đơn giản cũng giúp cả công ty nói chung một ngôn ngữ khi đánh giá model, thay vì mỗi phòng ban giữ một ấn tượng riêng. Nếu bạn muốn có sẵn khung tiêu chí và mẫu bảng chấm điểm để bắt đầu ngay hôm nay, đội ngũ BeelyWeb đã chuẩn bị sẵn một bộ tài liệu tham khảo phù hợp với nhiều loại tác vụ doanh nghiệp thường gặp.
Muốn có sẵn khung tiêu chí và mẫu bảng chấm điểm mù để dựng bộ đánh giá nội bộ ngay hôm nay? Hãy tải checklist/template từ đội ngũ BeelyWeb và bắt đầu áp dụng cho model đang dùng.