Bài toán nào hợp với AI
AI hợp nhất với những việc lặp lại, cần hiểu ngôn ngữ, và chấp nhận được sai sót nhỏ. Ba điều kiện phải có đủ.
Phân loại email khách hàng gửi tới rồi chuyển đúng bộ phận — hợp. Việc này lặp hàng trăm lần mỗi ngày, cần hiểu nội dung viết tự do, và nếu phân sai một lá thư thì người nhận chuyển tiếp được.
Tính lương — không hợp. Nó lặp lại, nhưng không cần hiểu ngôn ngữ và không chấp nhận được sai sót. Bài toán này thuộc về một hàm được viết rõ ràng, không thuộc về một model xác suất.
Đây là chỗ nhiều dự án AI đi sai ngay từ đầu: chọn một bài toán đòi hỏi độ chính xác tuyệt đối rồi ngạc nhiên khi kết quả không dùng được.
RAG — cho AI đọc dữ liệu của bạn
Một LLM — large language model, mô hình ngôn ngữ lớn — không biết gì về tài liệu nội bộ của công ty bạn. Hỏi nó về quy trình duyệt chi của phòng kế toán thì nó sẽ bịa ra một câu trả lời nghe rất hợp lý.
RAG (Retrieval-Augmented Generation) là cách xử lý: trước khi trả lời, hệ thống tìm trong kho tài liệu của bạn những đoạn liên quan tới câu hỏi, rồi đưa chúng vào cùng câu hỏi cho model. Model trả lời dựa trên tài liệu thật thay vì dựa trên trí nhớ mơ hồ từ lúc huấn luyện.
Kết quả tốt hay không phụ thuộc phần lớn vào bước tìm kiếm, không phải bước sinh câu trả lời. Tìm sai đoạn thì model dù mạnh tới đâu cũng trả lời sai. Vì vậy phần lớn công sức của một dự án RAG nằm ở việc chia nhỏ tài liệu, đánh chỉ mục, và kiểm tra xem truy vấn thật có lấy ra đúng đoạn không.
Cloud hay on-premise
Gọi API của OpenAI hay Anthropic thì nhanh, rẻ khi lượng dùng còn nhỏ, và luôn có model mới nhất. Đổi lại, dữ liệu rời khỏi hạ tầng của bạn.
Với phần lớn bài toán thì điều đó chấp nhận được. Với hồ sơ bệnh án, dữ liệu nhân sự hay tài liệu thuộc diện bảo mật theo hợp đồng thì không.
Chạy model on-premise — trên máy chủ của chính bạn — giải quyết được vấn đề đó, nhưng phải trả giá: cần GPU, cần người vận hành, và model chạy được trên hạ tầng vừa phải thường yếu hơn model thương mại tốt nhất. 9G Platform được xây để quản lý cả hai loại trên cùng một hệ thống, nên có thể để dữ liệu nhạy cảm chạy nội bộ còn phần còn lại dùng cloud.
Đo kết quả thế nào
Một dự án AI không có cách đo thì không kết thúc được — luôn có thể chỉnh thêm prompt, luôn có thể thử model khác.
Nên thống nhất thước đo trước khi viết dòng code đầu tiên, và thước đo phải là con số của nghiệp vụ chứ không phải của model. Không phải "độ chính xác 92%", mà là "số email phải phân loại tay giảm từ 400 xuống 60 mỗi ngày". Con số thứ hai nói lên hệ thống có đáng tiền không; con số thứ nhất thì không.
Kèm theo đó là một tập dữ liệu kiểm thử lấy từ chính công việc thật, đủ để chạy lại mỗi khi đổi prompt hay đổi model và biết ngay là tốt lên hay tệ đi.