Bản thiết kế 7 lớp giúp doanh nghiệp phân biệt chatbot, workflow và AI agent — rồi đưa agent vào vận hành mà không đánh đổi quyền kiểm soát.
Một mô hình ngôn ngữ có thể viết email rất hay. Nhưng nếu không có quyền đọc hộp thư, đối chiếu lịch, gọi công cụ và ghi nhớ lựa chọn của người dùng, nó vẫn chỉ là một “bộ não” đang ngồi trong phòng kín.
Đây là chỗ nhiều dự án AI doanh nghiệp nhầm lẫn: thấy mô hình trả lời thông minh, rồi gọi toàn bộ giải pháp là AI agent. Trên thực tế, khoảng cách từ “biết nói” đến “biết làm” không nằm ở một prompt dài hơn. Nó nằm ở kiến trúc bao quanh mô hình.
Một agent đáng tin cậy phải nhận được mục tiêu, quan sát môi trường, suy luận, lập kế hoạch, hành động qua công cụ, ghi nhớ kết quả và phối hợp với con người hoặc agent khác. Quan trọng hơn, toàn bộ vòng lặp ấy phải có giới hạn quyền hạn, dấu vết kiểm toán và điểm dừng rõ ràng.
Bài viết này trình bày một bản thiết kế đủ thực dụng để đội ngũ lãnh đạo, sản phẩm và kỹ thuật cùng trả lời ba câu hỏi:
Khi nào bài toán chỉ cần LLM hoặc workflow, khi nào mới cần agent?
Một agent doanh nghiệp gồm những khối kiến trúc nào?
Nên triển khai theo thứ tự nào để tạo giá trị mà vẫn kiểm soát rủi ro?
Đừng gọi mọi thứ có LLM là “agent”
Có ba cấp độ thường bị trộn lẫn.
LLM: giỏi tạo đầu ra, nhưng thụ động
LLM nhận đầu vào và tạo đầu ra: viết, tóm tắt, phân loại, trích xuất hoặc giải thích. Mô hình có thể rất thông minh, thậm chí xử lý đồng thời văn bản, hình ảnh, âm thanh. Nhưng bản thân mô hình không tự duy trì mục tiêu, không chủ động mở hệ thống nghiệp vụ và không chịu trách nhiệm đưa một công việc đến trạng thái hoàn tất.
Ví dụ: nhân viên yêu cầu “soạn email nhắc khách hàng thanh toán”. LLM tạo ra email. Con người vẫn phải kiểm tra công nợ, tìm địa chỉ, bấm gửi và cập nhật CRM.
Workflow tự động: biết làm, nhưng đi theo đường ray
Workflow thực thi chuỗi bước được định nghĩa trước: khi có sự kiện A thì làm B, nếu điều kiện C thì chuyển sang D. Nó rất phù hợp với quy trình ổn định, đầu vào có cấu trúc và ngoại lệ đã biết.
Ví dụ: mỗi thứ Hai lúc 9 giờ, hệ thống tổng hợp báo cáo bán hàng rồi gửi cho quản lý. Workflow nhanh, rẻ, dễ kiểm thử; nhưng khi thiếu dữ liệu ở một chi nhánh, nó thường dừng lại hoặc chạy theo nhánh ngoại lệ đã được lập trình.
AI agent: theo đuổi mục tiêu trong môi trường có biến động
Agent nhận một mục tiêu, tự xác định bước tiếp theo dựa trên trạng thái hiện tại, gọi công cụ, quan sát kết quả và điều chỉnh kế hoạch. Nếu một nguồn dữ liệu lỗi, agent có thể thử nguồn thay thế, yêu cầu bổ sung thông tin hoặc chuyển cho con người thay vì chỉ “chạy tiếp”.
Ví dụ: “giảm số hóa đơn quá hạn trong tháng này”. Agent có thể phân nhóm khách hàng, kiểm tra lịch sử trao đổi, đề xuất cách tiếp cận, soạn thông điệp, chờ phê duyệt ở trường hợp nhạy cảm, gửi qua kênh phù hợp và cập nhật kết quả.
Sự khác biệt cốt lõi không phải là mức độ trôi chảy của câu trả lời. Đó là mức tự chủ trong quyết định và hành động.
Một nguyên tắc thiết kế hữu ích là: hãy dùng mức tự chủ thấp nhất vẫn giải quyết được bài toán. Nếu quy trình đã rõ và ổn định, workflow thường tốt hơn agent. Agent chỉ đáng đầu tư khi đường đi phụ thuộc vào ngữ cảnh, có nhiều ngoại lệ và cần điều chỉnh kế hoạch trong lúc thực thi.
Bản thiết kế 7 lớp của một AI agent
Có thể hình dung agent như một vòng vận hành liên tục gồm bảy khối: Mục tiêu → Cảm nhận → Suy luận → Lập kế hoạch → Hành động → Bộ nhớ → Phối hợp. Mỗi khối trả lời một câu hỏi kiến trúc khác nhau.
1. Mục tiêu: agent đang tối ưu điều gì?
Mục tiêu không nên là một câu mơ hồ như “chăm sóc khách hàng tốt hơn”. Nó cần được chuyển thành kết quả có thể kiểm tra, ràng buộc và điều kiện kết thúc.
Một đặc tả mục tiêu tốt thường có:
Kết quả mong muốn: chẳng hạn xử lý yêu cầu hoàn tiền hợp lệ trong 24 giờ.
Ràng buộc: không hoàn quá hạn mức; không lộ dữ liệu cá nhân; giao người thật khi có dấu hiệu gian lận.
Thước đo: thời gian xử lý, tỷ lệ giải quyết đúng, số lần con người phải can thiệp.
Điều kiện dừng: hoàn tất, hết thời gian, thiếu dữ liệu hoặc vượt ngưỡng rủi ro.
Nếu không định nghĩa rõ mục tiêu, một agent có thể hoàn thành “đúng câu chữ” nhưng sai ý định kinh doanh.
2. Cảm nhận: agent biết điều gì đang xảy ra?
Đây là lớp tiếp nhận tín hiệu từ môi trường: yêu cầu người dùng, sự kiện trong CRM, tồn kho từ ERP, tài liệu, email, log hệ thống hoặc dữ liệu cảm biến.
Chất lượng suy luận không thể cao hơn chất lượng ngữ cảnh. Vì vậy, lớp cảm nhận phải giải quyết ba việc: lấy đúng dữ liệu, chuẩn hóa dữ liệu và gắn nguồn gốc cho từng dữ kiện. Một dashboard đẹp không cứu được agent nếu số liệu đến trễ hoặc không có “phiên bản sự thật duy nhất”.
3. Suy luận: điều gì đáng chú ý và nên chọn hướng nào?
LLM thường nằm ở đây. Nó diễn giải ý định, so sánh trạng thái hiện tại với mục tiêu, nhận diện rủi ro và đề xuất chiến lược. Nhưng “LLM là bộ não” không đồng nghĩa với việc giao toàn quyền cho mô hình.
Doanh nghiệp vẫn cần các lớp kiểm soát mang tính xác định: chính sách, rule engine, bộ lọc dữ liệu, kiểm tra quyền truy cập và bộ đánh giá đầu ra. Mô hình xử lý phần mơ hồ; phần bất biến nên để mã nguồn và chính sách đảm nhiệm.
4. Lập kế hoạch: biến chiến lược thành các bước có thể thực thi
Từ một mục tiêu lớn, agent chia thành chuỗi nhiệm vụ: cần dữ liệu gì, gọi công cụ nào, bước nào có thể chạy song song, bước nào phải chờ phê duyệt.
Kế hoạch không nhất thiết được lập một lần rồi giữ nguyên. Agent tốt sẽ lập kế hoạch theo chặng ngắn, kiểm tra kết quả sau mỗi hành động và tái lập kế hoạch khi bối cảnh thay đổi. Cách này giảm chi phí sai lầm so với việc để agent “chạy một mạch” qua hàng chục bước.
5. Hành động: agent có thể thay đổi thế giới đến đâu?
Agent hành động thông qua công cụ: truy vấn dữ liệu, tạo ticket, cập nhật CRM, gửi email, đặt lịch hoặc kích hoạt một dịch vụ khác.
Đây là lớp tạo ra giá trị, đồng thời cũng là lớp tạo ra rủi ro lớn nhất. Mỗi công cụ nên có:
Phạm vi quyền hạn tối thiểu;
Schema đầu vào và đầu ra rõ ràng;
Cơ chế idempotency để tránh thực thi lặp;
Timeout, retry và giới hạn tần suất;
Nhật ký ai yêu cầu, agent quyết định gì và công cụ đã làm gì;
Bước phê duyệt đối với hành động khó đảo ngược.
Một agent được phép “soạn lệnh chuyển tiền” khác hoàn toàn agent được phép “thực hiện chuyển tiền”. Kiến trúc phải thể hiện ranh giới đó bằng quyền kỹ thuật, không chỉ bằng prompt.
6. Bộ nhớ: agent cần nhớ gì, trong bao lâu?
Bộ nhớ ngắn hạn giữ trạng thái của phiên làm việc: mục tiêu, bước đã chạy, kết quả công cụ. Bộ nhớ dài hạn có thể lưu sở thích, bài học, lịch sử tương tác hoặc tri thức đã được xác thực.
Không phải dữ liệu nào cũng nên được nhớ. Hãy đặt chính sách về thời hạn lưu, dữ liệu nhạy cảm, quyền được quên và nguồn nào được phép trở thành “sự thật”. Nếu ghi mọi thứ vào vector database rồi gọi đó là memory, doanh nghiệp chỉ đang biến nhiễu thành một lớp hạ tầng đắt tiền.
7. Phối hợp: ai giữ quyền quyết định cuối cùng?
Agent có thể phối hợp trực tiếp bằng thông điệp, hoặc gián tiếp qua trạng thái chung như cơ sở dữ liệu, hàng đợi và bảng công việc. Khi có nhiều agent, thiết kế cần chỉ rõ vai trò, hợp đồng giao tiếp, quyền sở hữu dữ liệu và cách xử lý xung đột.
Một hệ thống nhiều agent không mặc nhiên tốt hơn một agent. Nó chỉ hợp lý khi công việc có các miền chuyên môn, quyền hạn hoặc vòng đời độc lập. Nếu không, chi phí điều phối và quan sát có thể lớn hơn giá trị mang lại.
Từ function calling đến MCP và A2A: ba tầng kết nối
Vòng lặp agent chỉ hoạt động khi kết nối được với môi trường. Có thể chia lớp kết nối thành ba tầng.
Function calling là tầng gần nhất: mô hình chọn một hàm nội bộ và tạo tham số để ứng dụng gọi hàm đó. Nó phù hợp khi công cụ nằm trong cùng hệ thống và đội phát triển kiểm soát toàn bộ runtime.
Giao thức công cụ như MCP tách công cụ khỏi agent. Công cụ có thể được mô tả, khám phá và gọi qua một hợp đồng chuẩn, thay vì tích hợp riêng cho từng framework. Giá trị kiến trúc nằm ở khả năng thay thế và quản trị dịch vụ, không phải ở việc “có thêm một API”.
Giao thức agent-to-agent như A2A phục vụ việc giao nhiệm vụ giữa các agent độc lập, có thể thuộc các hệ thống hoặc tổ chức khác nhau. Tầng này cần khi quy trình mang tính bất đồng bộ, có trạng thái dài và mỗi bên sở hữu năng lực riêng.
Đừng áp cả ba tầng chỉ vì chúng đang được nhắc tới nhiều. Một công cụ nội bộ đơn giản không cần biến thành mạng agent. Hãy chọn lớp kết nối dựa trên ranh giới sở hữu, vòng đời triển khai và yêu cầu bảo mật.
Hai cách agent phối hợp — và một lựa chọn lai
Trong mô hình giao tiếp trực tiếp, agent gửi thông điệp có cấu trúc cho agent khác. Ưu điểm là ý định rõ và phản hồi nhanh. Nhược điểm là các bên dễ phụ thuộc vào nhau; thay đổi hợp đồng ở một agent có thể gây lỗi dây chuyền.
Trong mô hình giao tiếp gián tiếp, agent cập nhật môi trường chung rồi agent khác quan sát thay đổi. Cách này giảm ghép nối và phù hợp với luồng bất đồng bộ, nhưng cần quản lý trạng thái, thứ tự sự kiện và tính nhất quán kỹ hơn.
Thực tế, hệ thống doanh nghiệp thường dùng mô hình lai: gọi trực tiếp cho tác vụ cần phản hồi tức thời; dùng sự kiện hoặc bảng trạng thái cho quy trình dài. Tiêu chí chọn không phải “công nghệ nào hiện đại hơn”, mà là hệ thống cần nhất quán đến mức nào, chịu được độ trễ bao nhiêu và khôi phục ra sao khi một thành phần ngừng hoạt động.
Lộ trình triển khai: tăng quyền tự chủ theo từng nấc
Sai lầm phổ biến là bắt đầu bằng một “nhân viên AI toàn năng”. Cách an toàn hơn là tăng quyền theo bằng chứng vận hành.
Bước 1: Chọn một mục tiêu hẹp nhưng có giá trị
Chọn quy trình có tần suất đủ lớn, dữ liệu tiếp cận được và kết quả đo lường rõ. Tránh quy trình vừa hiếm, vừa rủi ro cao, vừa không có dữ liệu lịch sử.
Đừng hỏi “phòng ban nào cần agent?”. Hãy hỏi “quyết định lặp lại nào đang tiêu tốn nhiều thời gian vì phải gom ngữ cảnh từ nhiều nơi?”.
Bước 2: Dựng đường cơ sở bằng workflow và copilot
Trước khi trao quyền hành động, hãy để AI đề xuất và con người duyệt — tương tự cách quản trị AI như một nhân viên mới. Giai đoạn này tạo dữ liệu đánh giá: agent sai ở đâu, ngoại lệ nào xuất hiện, con người sửa điều gì và chi phí thực sự trên mỗi nhiệm vụ là bao nhiêu.
Bước 3: Chuẩn hóa công cụ và trạng thái
Mỗi công cụ cần hợp đồng rõ, quyền tối thiểu và khả năng kiểm thử độc lập. Trạng thái nhiệm vụ phải tồn tại ngoài cửa sổ hội thoại để hệ thống có thể tiếp tục, khôi phục và kiểm toán.
Nếu API nội bộ không ổn định, agent sẽ khuếch đại sự hỗn loạn thay vì sửa nó.
Bước 4: Thiết kế vòng kiểm soát trước khi mở rộng quyền
Phân loại hành động thành ba nhóm:
Tự động thực hiện: rủi ro thấp, dễ đảo ngược;
Thực hiện có điều kiện: cần kiểm tra rule hoặc ngưỡng;
Bắt buộc phê duyệt: tác động tài chính, pháp lý, dữ liệu cá nhân hoặc khó đảo ngược.
Bổ sung quan sát ở cấp nhiệm vụ: tỷ lệ hoàn tất, số vòng lặp, số lần gọi công cụ, chi phí, thời gian, tỷ lệ bàn giao cho người và nguyên nhân thất bại.
Bước 5: Chỉ tách thành multi-agent khi ranh giới đã rõ
Hãy tách agent khi có ít nhất một trong ba lý do: chuyên môn khác biệt, quyền hạn khác biệt hoặc nhu cầu mở rộng độc lập. Mỗi agent cần một trách nhiệm đơn nhất, hợp đồng vào/ra và một chủ sở hữu vận hành.
Tăng số agent trước khi có khả năng quan sát chỉ khiến lỗi khó truy vết hơn.
Checklist kiến trúc trước khi đưa vào production
Trước khi ký duyệt một hệ thống agentic, đội ngũ có thể kiểm tra nhanh:
Mục tiêu có đo được và có điều kiện dừng không?
Agent lấy ngữ cảnh từ nguồn nào, độ mới và quyền truy cập ra sao?
Phần nào do LLM quyết định, phần nào do rule cưỡng chế?
Mỗi hành động có giới hạn quyền và khả năng hoàn tác không?
Trạng thái có thể khôi phục sau lỗi hoặc timeout không?
Bộ nhớ lưu gì, bao lâu và ai có quyền xóa?
Khi thiếu tự tin, agent sẽ hỏi lại, thử cách khác hay chuyển cho người?
Có bộ dữ liệu đánh giá từ các tình huống thật không?
Log có đủ để tái hiện một quyết định không?
Chi phí và độ trễ có được đo trên toàn nhiệm vụ, thay vì trên một lần gọi model không?
Nếu chưa trả lời được các câu hỏi này, vấn đề không nằm ở việc chọn model nào; bài viết về kiến trúc đưa LLM vào production đi sâu hơn vào các lớp kiểm soát này. Vấn đề là kiến trúc chưa sẵn sàng.
Kết luận: Agent là một hệ thống, không phải một tính năng của LLM
LLM mang lại năng lực hiểu và suy luận. Workflow mang lại tính lặp lại và kiểm soát. Agent kết hợp hai yếu tố ấy với mục tiêu, công cụ, trạng thái, bộ nhớ và cơ chế phối hợp để theo đuổi kết quả trong một môi trường thay đổi.
Nhưng tự chủ không phải nút bật/tắt. Đó là một phổ quyền hạn cần được mở dần theo bằng chứng. Doanh nghiệp tạo ra lợi thế không phải bằng cách trao cho AI nhiều quyền nhất, mà bằng cách thiết kế đúng quyền, đúng ngữ cảnh, đúng điểm kiểm soát.
Nếu chỉ giữ lại một nguyên tắc, hãy giữ nguyên tắc này: đừng bắt đầu từ câu hỏi “agent có thể làm gì?”, hãy bắt đầu từ “mục tiêu nào đủ rõ để một hệ thống có thể chịu trách nhiệm đến cùng?”






Agent không phải là một prompt dài hơn, mà là một hệ thống có mục tiêu, công cụ, trạng thái và giới hạn quyền hạn. Theo bạn, quy trình nào trong doanh nghiệp nên được nâng từ workflow lên agent trước tiên?