BeelyWeb
31/08/2026

Kiến trúc một AI Agent: các khối bắt buộc phải có

Phong Nguyen
Kiến trúc một AI Agent: các khối bắt buộc phải có

Khi ngồi trước một nhà cung cấp giải pháp AI Agent và nghe họ thuyết trình đầy tự tin về "trí tuệ nhân tạo tiên tiến", bạn có biết chính xác nên hỏi những gì để biết bên trong sản phẩm đó thật sự có gì, hay chỉ có thể gật gù rồi tin theo nhỉ?

Rất nhiều doanh nghiệp rơi vào tình huống ký hợp đồng với một giải pháp agent chỉ dựa trên một bản demo được dàn dựng đẹp mắt, để rồi vài tháng sau mới phát hiện ra hệ thống không nhớ được lịch sử làm việc với khách hàng cũ, hoặc tệ hơn là từng có lần tự ý thực hiện một thao tác sai trên dữ liệu thật mà không ai kịp ngăn lại. Vấn đề không chỉ nằm ở việc công nghệ chưa đủ tốt, mà còn nằm ở việc người mua chưa biết cách "mở nắp" để nhìn vào bên trong xem sản phẩm được ráp từ những gì, và việc hiểu đúng năm khối cấu thành dưới đây sẽ giúp bạn tự tin làm điều đó.

Vậy nên bài viết này sẽ giải phẫu một AI Agent thành năm khối chức năng bắt buộc phải có, kèm ví dụ cụ thể và một câu hỏi nên hỏi thẳng nhà cung cấp cho từng khối - để lần tới khi ngồi trước một buổi demo, bạn là người đặt câu hỏi khiến người trình bày phải trả lời thực chất, thay vì chỉ ngồi nghe những mỹ từ chung chung.

  1. 1

    Bộ lập kế hoạch (Planner)

    Đây là bộ phận chịu trách nhiệm chia một mục tiêu lớn thành các bước nhỏ có thứ tự, quyết định bước nào cần làm trước, bước nào có thể bỏ qua nếu điều kiện không thoả. Không có bộ phận này, hệ thống chỉ có thể phản hồi một câu hỏi rồi dừng lại chứ không thể tự theo đuổi một mục tiêu nhiều bước - chính planner giúp một yêu cầu mơ hồ trở thành một chuỗi hành động cụ thể. Ví dụ, khi nhận yêu cầu "xử lý các đơn hàng trễ hạn trong tuần này", planner sẽ tự quyết định trình tự: lọc danh sách đơn trễ hạn trước, phân loại theo mức độ nghiêm trọng, rồi mới soạn hành động phù hợp cho từng nhóm - đúng như cách các nền tảng như ADK của Google mô tả việc điều phối theo luồng cố định hoặc theo định tuyến linh hoạt tuỳ tình huống thực tế.

    Câu hỏi nên hỏi nhà cung cấp

    "Khi gặp tình huống không có sẵn trong kịch bản, planner tự suy luận bước tiếp theo như thế nào, và quyết định đó có được ghi lại để xem lại sau này không?"

  2. 2

    Bộ nhớ (Memory)

    Bộ nhớ giúp agent không quên mất việc đang làm dở giữa chừng, và thường được chia thành hai lớp: bộ nhớ ngắn hạn chỉ tồn tại trong một phiên làm việc, và bộ nhớ dài hạn được giữ lại giữa các phiên khác nhau để agent "nhớ" được khách hàng quen hay quy tắc đã học từ những lần xử lý trước. Theo tài liệu công khai của Amazon về dịch vụ Bedrock AgentCore, đây chính xác là cách họ tách bộ nhớ thành hai lớp riêng biệt, với lớp dài hạn được thiết kế để agent có thể chia sẻ và học từ kinh nghiệm giữa nhiều lượt tương tác. Một agent không có bộ nhớ dài hạn sẽ luôn "gặp khách hàng lần đầu" dù đã trò chuyện với người đó cả chục lần trước đó, trong khi một agent có bộ nhớ tốt sẽ giúp cuộc trò chuyện lần sau liền mạch và cá nhân hoá hơn hẳn.

    Câu hỏi nên hỏi nhà cung cấp

    "Bộ nhớ dài hạn của agent được lưu trữ ở đâu, ai có quyền truy cập, và dữ liệu đó có thể được xoá theo yêu cầu của khách hàng khi cần không?"

  3. 3

    Lớp công cụ (Tool layer)

    Lớp công cụ là nơi định nghĩa chính xác "agent được phép làm gì" bằng cách kết nối nó với phần mềm thật thông qua cơ chế tool calling, hiểu đơn giản là một danh sách các thao tác cụ thể - tra cứu đơn hàng, gửi email, cập nhật bảng tính - mà agent có thể gọi khi cần. Đây cũng là khối mà dịch vụ Gateway của Bedrock AgentCore đảm nhiệm rất rõ ràng: chuyển các API và phần mềm nội bộ có sẵn của doanh nghiệp thành công cụ mà agent gọi được một cách an toàn, thay vì để agent truy cập trực tiếp vào hệ thống gốc. Không chỉ giúp agent "có tay chân" để hành động, lớp công cụ còn là nơi bạn kiểm soát được chính xác agent được chạm vào phần mềm nào và không được chạm vào phần mềm nào - danh sách công cụ càng được định nghĩa rõ ràng, agent càng khó lỡ tay làm sai việc ngoài phạm vi cho phép. Nếu muốn hiểu sâu hơn cơ chế này hoạt động ra sao ở tầng kỹ thuật, bạn có thể đọc thêm Tool calling: cách AI Agent gọi được phần mềm của bạn.

    Câu hỏi nên hỏi nhà cung cấp

    "Danh sách công cụ agent được phép gọi cụ thể là gì, và có thể giới hạn một công cụ chỉ ở quyền đọc dữ liệu, không cho phép ghi hay xoá hay không?"

  4. 4

    Vòng lặp thực thi (Execution loop)

    Đây là "trái tim" giữ cho agent tiếp tục làm việc: nó lặp lại chu trình suy nghĩ - hành động - quan sát kết quả, rồi suy nghĩ tiếp cho tới khi mục tiêu hoàn thành hoặc chạm một giới hạn được định trước như số vòng lặp tối đa hay thời gian chờ. Những framework như LangGraph mô tả rất rõ cơ chế này bằng mô hình đồ thị, nơi mỗi bước xử lý là một node, và một cơ chế gọi là checkpointer sẽ lưu lại tiến trình để agent có thể chạy được những việc kéo dài nhiều bước, thậm chí phục hồi đúng chỗ đang dang dở nếu có sự cố giữa chừng thay vì phải làm lại từ đầu. Vừa giúp agent bền bỉ với việc dài hơi, một vòng lặp thực thi có kiểm soát tốt vừa giúp bạn tránh được tình huống agent "chạy mãi không dừng" mà không ai hay biết.

    Câu hỏi nên hỏi nhà cung cấp

    "Nếu agent chạy quá lâu hoặc lặp đi lặp lại một bước mà không tiến triển, hệ thống có tự động dừng lại không, và ai sẽ được thông báo khi điều đó xảy ra?"

  5. 5

    Cơ chế kiểm soát (Control)

    Khối cuối cùng nhưng quan trọng không kém là cơ chế kiểm soát: rào chắn kiểm tra đầu vào và đầu ra, phân quyền rõ ràng cho từng hành động, và một điểm dừng bắt buộc xin duyệt con người trước khi thực hiện việc nhạy cảm. Theo tài liệu công khai của các nhà cung cấp, đây là khối được đầu tư rất nghiêm túc dưới nhiều tên gọi khác nhau: OpenAI gọi là Guardrails, Claude Agent SDK gọi là Permissions, Microsoft thiết kế cơ chế human-in-the-loop ngay trong hướng dẫn xây dựng autonomous agent của Copilot Studio, còn Amazon tách hẳn thành hai dịch vụ riêng là Identity và Policy để quản lý danh tính và luật chơi cho agent. Tuy mỗi nơi gọi một tên nhưng bản chất đều giống nhau: đảm bảo agent không tự ý vượt quá ranh giới đã được cho phép, và chính khối này giúp doanh nghiệp yên tâm giao việc mà không phải lo canh chừng agent suốt ngày.

    Câu hỏi nên hỏi nhà cung cấp

    "Ở những bước nào hệ thống bắt buộc dừng lại chờ người thật phê duyệt, và toàn bộ quyết định cùng lý do đi kèm có được ghi log đầy đủ để truy vết lại sau này không?"

Ghép năm khối lại, bạn có một agent thật

Không chỉ cần có mặt cả năm khối, một AI Agent đáng tin cậy còn cần năm khối này phối hợp nhịp nhàng với nhau: planner quyết định bước tiếp theo, memory cung cấp ngữ cảnh cần thiết cho quyết định đó, tool layer thực thi hành động, execution loop giữ nhịp lặp lại cho tới khi xong việc, còn control đứng canh suốt quá trình để can thiệp đúng lúc nếu có gì bất thường. Tuy nghe có vẻ phức tạp nhưng khi đánh giá một giải pháp cụ thể, bạn không cần hiểu sâu về mặt kỹ thuật của từng khối, chỉ cần hỏi đúng năm câu hỏi ở trên là đã đủ giúp bạn phân biệt một giải pháp agent được xây dựng nghiêm túc với một sản phẩm chỉ khoác tên "AI Agent" cho có phong trào.

Đặc biệt, khối kiểm soát luôn là khối đáng dành nhiều thời gian thẩm định nhất, vì đây chính là lớp bảo vệ cuối cùng đứng giữa một agent hữu ích và một sự cố ngoài ý muốn trên dữ liệu thật của doanh nghiệp bạn.

Thử hình dung lại ví dụ "xử lý các đơn hàng trễ hạn trong tuần này" ở phần đầu bài để thấy năm khối này thật sự làm việc cùng nhau như thế nào: planner tách yêu cầu thành các bước lọc - phân loại - hành động; memory kéo ra thông tin những khách hàng đã từng khiếu nại trễ hạn trước đó để agent biết nên ưu tiên xin lỗi nhóm nào trước; tool layer gọi vào hệ thống quản lý đơn hàng để lấy dữ liệu thật và soạn email; execution loop lặp lại quy trình này cho từng đơn hàng trong danh sách cho tới khi xử lý xong toàn bộ; còn control đứng giám sát suốt quá trình, và nếu agent chuẩn bị gửi một mã giảm giá vượt quá hạn mức được phép, đây chính là lúc nó phải dừng lại xin duyệt thay vì tự ý gửi đi. Một ví dụ tưởng chừng đơn giản nhưng lại chạm đủ cả năm khối, và đó cũng là lý do vì sao đánh giá một giải pháp agent không thể chỉ nhìn vào một bản demo ngắn ngủi.

Vài câu hỏi thường gặp

Có cần hiểu code để hỏi được năm câu hỏi này không?

Không cần. Cả năm câu hỏi đều là câu hỏi về hành vi và chính sách vận hành của hệ thống, không đòi hỏi bạn biết đọc code hay hiểu thuật toán. Một nhà cung cấp nghiêm túc phải trả lời rõ ràng được cả năm câu này bằng ngôn ngữ thông thường.

Nếu nhà cung cấp không trả lời rõ được một trong năm khối này thì sao?

Đó là tín hiệu đáng cân nhắc lại. Không trả lời rõ được câu hỏi về bộ nhớ hay cơ chế kiểm soát thường có nghĩa là khối đó chưa được thiết kế kỹ, hoặc sản phẩm thực chất gần với một trợ lý ảo có kịch bản hơn là một AI Agent đúng nghĩa - điều này không sai, nhưng bạn cần biết trước để so đúng giá trị với mức giá được chào.

Nếu bạn đang cầm trong tay một bản báo giá AI Agent và chưa chắc chắn cả năm khối kiến trúc ở trên có thật sự vững hay không, đội ngũ BeelyWeb có thể cùng bạn rà lại từng khối trước khi ký hợp đồng. Muốn tìm hiểu thêm về ranh giới giữa các loại giải pháp AI hiện nay, bạn có thể đọc thêm AI Agent là gì: từ chatbot đến quy trình tự vận hành, hoặc liên hệ trực tiếp với chúng tôi để được rà soát cùng bạn nhé.