Một ngân hàng ở TP.HCM dùng một LLM đa dụng để xử lý hàng loạt hồ sơ KYC tiếng Việt. Một bệnh viện ở Jakarta giao cho một model có sẵn nhiệm vụ tóm tắt hồ sơ bệnh nhân. Một công ty bảo hiểm ở Bangkok tích hợp GPT vào quy trình xử lý claim vì đó là cách nhanh nhất để ra demo. Cả ba đều theo cùng một công thức: chọn model lớn nhất, mạnh nhất trên thị trường, viết prompt cho tốt, rồi hy vọng độ chính xác sẽ tự đến.
Nhưng với ngày càng nhiều doanh nghiệp Đông Nam Á, điều đó không xảy ra. Và khoảng cách giữa “model chạy demo ngon” và “model chạy được trong production” đã trở thành khoản “thuế” lớn nhất đang ăn vào ROI của generative AI trong khu vực.
Giới hạn của model AI đa dụng khi triển khai thực tế
Quy mô của vấn đề này không còn là chuyện cá biệt. Các báo cáo ngành hiện ghi nhận tỷ lệ thất bại của các sáng kiến AI doanh nghiệp lên tới 85%, và một con số được trích dẫn rộng rãi cho thấy khoảng 95% các pilot generative AI không mang lại ROI đo được nào một khi bước ra khỏi môi trường thử nghiệm (Syntes.ai, 2026). S&P Global cũng ghi nhận 42% doanh nghiệp đã từ bỏ sáng kiến AI chủ lực của mình trong giai đoạn 2025–2026, chỉ vì không thể chứng minh được đường đi tới ROI.
Điểm chung trong hầu hết các báo cáo hậu kỳ (post-mortem) không phải là model nền tảng yếu — các LLM hàng đầu hiện nay nói chung đều rất mạnh. Vấn đề là một model đa dụng, được huấn luyện trên dữ liệu toàn cầu, lại đang bị yêu cầu đưa ra những quyết định có tính xác định (deterministic) và rủi ro cao trong một bối cảnh kinh doanh cụ thể mà nó chưa từng được huấn luyện: ngôn ngữ địa phương, quy định pháp lý địa phương, định dạng tài liệu đặc thù, hệ thống phân loại nội bộ, và những trường hợp biên (edge case) chỉ xuất hiện trong dữ liệu lịch sử riêng của từng doanh nghiệp.
Gartner đã theo dõi sự dịch chuyển này ra khỏi cách triển khai model đa dụng chính vì lý do đó, và dự báo rằng hơn một nửa số triển khai generative AI trong doanh nghiệp sẽ là domain-specific (chuyên biệt theo lĩnh vực) vào năm 2027 — tăng mạnh so với chỉ khoảng 1% năm 2024. Đây không phải một xu hướng nhỏ lẻ; đó là một cuộc tái cấu trúc hạ tầng trong cách doanh nghiệp vận hành AI ở môi trường production.
Hai nguyên nhân tạo ra khoảng cách độ chính xác
Với doanh nghiệp Đông Nam Á, khoảng cách này có hai lớp, và hai lớp này cộng dồn lẫn nhau.
Lớp ngôn ngữ và khu vực. Phần lớn các LLM hàng đầu được huấn luyện chủ yếu trên dữ liệu tiếng Anh và tiếng Trung, còn các ngôn ngữ Đông Nam Á thường chỉ được xem như một mục phụ. Benchmark độc lập MMLU-ProX cho thấy khoảng cách độ chính xác lên tới 24.3% giữa các ngôn ngữ có nhiều tài nguyên và ngôn ngữ ít tài nguyên, trên cùng một câu hỏi — và tiếng Việt, Bahasa, tiếng Thái, tiếng Khmer đều nằm ở phía bất lợi của khoảng cách đó. Các model được huấn luyện riêng cho khu vực giúp thu hẹp khoảng cách này: trên benchmark kiến thức tổng hợp M3Exam, SeaLLMs-v3-7B đạt 64.9% với tiếng Việt, so với 62.4% của Qwen2-7B-Instruct (model đa dụng) và chỉ 51.3% của Sailor-7B. Với bài toán suy luận toán học tiếng Việt (MGSM), SeaLLMs-v3-7B đạt 71.2%, trong khi Meta-Llama-3-8B-Instruct chỉ đạt 46.8% (SeaLLMs 3, arXiv 2024). Cùng một nhiệm vụ, cùng độ khó, nhưng độ tin cậy chênh lệch rất lớn — chỉ vì cách model nền được huấn luyện khác nhau.
Lớp lĩnh vực (domain). Ngay cả khi một model xử lý tiếng Việt tốt, điều đó không có nghĩa là nó tự động hiểu checklist KYC của một ngân hàng, hệ thống phân loại claim của một công ty bảo hiểm, hay định dạng tóm tắt ra viện của một bệnh viện. Các model đa dụng chỉ đang “khớp mẫu” (pattern-match) với những gì gần giống nhất mà chúng từng thấy trong dữ liệu công khai — và với những nghiệp vụ nặng về tài liệu, chịu quy định pháp lý địa phương, thì “gần giống” thường không đủ. Đây chính là lớp mà hiện tượng hallucination (bịa thông tin) và phân loại sai lặng lẽ trà vào những kết quả tưởng như “đáng tin cậy cao” — loại lỗi trông rất ổn khi demo nhưng lại rớt ngay khi bị audit.
Khi khoảng cách khu vực cộng dồn lên khoảng cách lĩnh vực, sẽ dễ hiểu vì sao rất nhiều hệ thống AI ở Đông Nam Á khi lên production lại hoạt động kém hơn hẳn so với lúc pilot: model được kiểm định trên các benchmark công khai mang màu sắc tiếng Anh hoặc tiếng Trung, rồi lại bị giao một khối lượng công việc mà nó chưa từng thực sự được huấn luyện để xử lý.
Vì sao model nhỏ sau fine-tune vượt trội hơn model lớn đa dụng
Đây là phần đi ngược trực giác: để thu hẹp khoảng cách này, thường không cần một model lớn hơn. Cái cần là một model chuyên biệt hơn.
Các kỹ thuật fine-tune tiết kiệm tham số như LoRA và QLoRA có thể giảm hơn 90% lượng compute và dữ liệu cần thiết để chuyên biệt hóa một model, so với việc huấn luyện lại toàn bộ (full retraining) — cho phép một team điều chỉnh model 7B–14B chỉ với vài GPU, chứ không cần cả một data center. Trong các đánh giá nội bộ đối đầu trực tiếp, các model nhỏ và vừa sau khi fine-tune đã cho thấy vượt trội hơn các LLM đa dụng lớn hơn, đặc biệt trên các nhiệm vụ có cấu trúc, lặp lại, gắn chặt với một lĩnh vực cụ thể — đúng dạng công việc chiếm phần lớn trong rà soát KYC, phân loại claim bảo hiểm, hay soạn hồ sơ bệnh án (Forbes Technology Council, 2026). Riêng trong lĩnh vực tài chính, các model nhỏ sau fine-tune đã được dùng để đạt thời gian phản hồi dưới 100ms cho phát hiện gian lận, với chi phí inference cận biên gần như bằng 0 — một mức độ trễ và chi phí mà việc gọi API tới một model nền tảng lớn không thể sánh được.
Đó chính là hướng đi mà các doanh nghiệp Đông Nam Á đang dần hội tụ về: thay vì đưa mọi hồ sơ KYC tiếng Việt, mọi ticket khách hàng tiếng Bahasa, hay mọi form claim tiếng Thái qua một API đa dụng đắt đỏ, hãy fine-tune một model nền nhỏ hơn nhưng hiểu ngữ cảnh khu vực, trên chính dữ liệu lịch sử của doanh nghiệp. Kết quả thường lặp lại theo một khuôn mẫu giống nhau: độ chính xác tăng lên vì model đã thực sự “thấy” các loại tài liệu của doanh nghiệp từ trước; độ trễ giảm xuống vì model nhỏ hơn và có thể được triển khai gần với dữ liệu; và chi phí mỗi lượt inference cũng giảm vì không còn phải trả mức giá API của một model nền tảng lớn cho một nhiệm vụ vốn rất hẹp về phạm vi.
Ứng dụng thực tế trên GreenNode AI Platform
AI Platform hiện chia việc truy cập model thành đúng hai hướng mà bài viết này đang dẫn tới:
- Model bên thứ ba (third-party), gọi qua API. Thông qua AI Gateway, các team có thể tiếp cận các model được host sẵn như Kimi, MiniMax, Qwen 3.x và GLM mà không cần tích hợp riêng với từng nhà cung cấp, khởi động nhanh, phù hợp để làm prototype hoặc các nhiệm vụ không quá rủi ro. Nhưng về bản chất, bạn đang “đi thuê” trọng số (weights) của người khác: không thể fine-tune trên dữ liệu riêng, và mỗi request vẫn phải trả theo mức giá API của nhà cung cấp đó.
- Model tự host (self-hosted), triển khai trên GPU riêng của bạn. Các model này chạy trên chính hạ tầng của AI Platform (hiện tại gồm Gemma) — và đây chính là điều kiện để việc fine-tune trở nên khả thi từ đầu. Self-hosted cũng không bị giới hạn trong một danh sách có sẵn: các phương thức import qua vLLM và custom container của Model Registry cho phép một team fine-tune một model mã nguồn mở, mạnh về khu vực như SeaLLMs, Qwen2.5, hoặc một checkpoint mở khác, ngay trong Notebook, rồi đưa đúng checkpoint đó vào để triển khai, thay vì bị bó buộc trong những gì có sẵn ở catalog deploy nhanh.
Phần còn lại của pipeline thì giống nhau, bất kể team bắt đầu từ base model self-hosted nào:
- Fine-tune mà không cần dựng hạ tầng riêng. Notebook instance cung cấp cho AI engineer một môi trường Jupyter có GPU (đã cài sẵn PyTorch) để chạy trực tiếp job fine-tune trên dữ liệu nội bộ, không cần mua sắm server hay quản lý cluster.
- Giữ dữ liệu huấn luyện và checkpoint đúng nơi cần ở. Network Volume là bộ nhớ lưu trữ dùng chung, bền vững, tự động đồng bộ giữa Notebook và Inference — nhờ đó, hồ sơ KYC, dữ liệu claim hay văn bản y tế không bao giờ phải “rời khỏi” một đường đi nội bộ được kiểm soát, chỉ để di chuyển giữa giai đoạn huấn luyện và triển khai.
- Quản lý phiên bản và kiểm soát những gì được triển khai. Model Registry theo dõi từng phiên bản đã fine-tune — được import qua Triton, vLLM, hoặc custom container — cùng với metadata và lineage của nó, giúp các team rollback, so sánh, hoặc audit xem checkpoint nào đang thực sự phục vụ traffic production.
- Triển khai thành API với độ trễ thấp. Inference biến model đã fine-tune thành một RESTful endpoint với cấu hình replica tự động scale, hoàn tất vòng lặp từ “model đã fine-tune” đến “tính năng AI trong sản phẩm.”
Ngoài ra còn có một lực đẩy từ phía pháp lý, thúc doanh nghiệp về phía self-hosted. Luật số 134/2025/QH15 của Việt Nam, có hiệu lực từ 1/3/2026, là đạo luật AI có tính ràng buộc pháp lý đầu tiên tại Đông Nam Á, trong đó có các yêu cầu về lưu trữ dữ liệu nội địa (data residency) — buộc các doanh nghiệp huấn luyện hoặc vận hành hệ thống AI trên dữ liệu của người Việt phải hướng về hạ tầng nội địa, thay vì đưa dữ liệu nhạy cảm qua các API bên thứ ba mà hạ tầng và cách xử lý dữ liệu nằm ngoài phạm vi kiểm soát của doanh nghiệp. Đây thực chất là cùng một sự đánh đổi third-party vs. self-hosted đã nói ở trên, chỉ khác là giờ có thêm một mốc thời hạn tuân thủ đi kèm. Fine-tune trên một nền tảng nội địa, self-hosted không còn đơn thuần là quyết định về độ chính xác và chi phí nữa, với các ngành chịu quản lý chặt (regulated industries), đây ngày càng trở thành một quyết định về tuân thủ pháp lý.
Model chuyên biệt: lợi thế cạnh tranh bền vữngh tranh thực sự
Dùng một model nền tảng đa dụng cho mọi nhiệm vụ AI trong doanh nghiệp cũng giống như dùng một cây búa quá cỡ cho mọi con vít trong nhà, nó vẫn “chạy được” đủ thường xuyên để tạo cảm giác hiệu quả, cho đến khi gặp đúng việc cần độ chính xác thực sự. Những doanh nghiệp đang thu hẹp khoảng cách độ chính xác ở Đông Nam Á không nhất thiết là những doanh nghiệp có quyền truy cập vào model lớn nhất. Họ là những doanh nghiệp sẵn sàng fine-tune một model nhỏ hơn, gắn chặt với ngữ cảnh khu vực, trên chính dữ liệu và quy trình của mình.
Đó là một lựa chọn hạ tầng có chủ đích, không phải một prompt gặp may. Khám phá Model Catalog trên GreenNode AI Platform để xem base model self-hosted nào và checkpoint mở theo khu vực nào bạn có thể đưa vào qua Notebook và Model Registry — sẽ cho team của bạn điểm khởi đầu tốt nhất để fine-tune trên chính dữ liệu lĩnh vực của mình.