SEAS
Quay về chương trình

SEAS 2026

ĐÁNH GIÁ ĐỘ BỀN VỮNG CỦA CÁC MÔ HÌNH NGÔN NGỮ LỚN TRÊN PHƯƠNG NGỮ TIẾNG VIỆT

Tiếng Việt có sự phân hóa phương ngữ phong phú giữa ba miền Bắc - Trung - Nam, nhưng dữ liệu huấn luyện của các mô hình ngôn ngữ lớn (LLM) hiện nay lại chủ yếu dựa trên tiếng Việt chuẩn. Điều này khiến các AI hoạt động rất tốt trên văn bản chuẩn nhưng dễ gặp "trục trặc" hoặc suy giảm chất lượng khi xử lý câu từ chứa phương ngữ vùng miền.

Đến với SEAS, nhóm nghiên cứu đã xây dựng một khung đánh giá hệ thống để đo lường mức độ ảnh hưởng của biến thể phương ngữ lên hiệu năng của các LLM phổ biến. Nhóm thu thập tập dữ liệu kiểm thử mang đặc trưng phương ngữ, sau đó thử nghiệm song song trên các tác vụ NLP để so sánh độ chính xác giữa đầu vào chuẩn và đầu vào phương ngữ.

Không chỉ dừng lại ở việc đánh giá, nhóm còn huấn luyện một mô hình dịch dựa trên kiến trúc mBART. Mô hình này đóng vai trò "bộ lọc" giúp chuyển đổi văn bản phương ngữ về tiếng Việt chuẩn trước khi đưa vào LLM, từ đó cải thiện đáng kể độ chính xác và độ bền vững cho hệ thống.

Nghiên cứu mang tính ứng dụng cao trong việc xây dựng tổng đài chăm sóc khách hàng tự động, giúp doanh nghiệp lựa chọn AI phù hợp, đồng thời đóng góp vào việc giáo dục và bảo tồn sự đa dạng ngôn ngữ.

Bối cảnh

  • Tiếng Việt là ngôn ngữ có sự phân hóa phương ngữ rõ rệt theo ba vùng chính: Bắc, Trung, Nam.
  • Phần lớn dữ liệu huấn luyện của các mô hình ngôn ngữ lớn (LLM) hiện nay chủ yếu dựa trên văn bản tiếng Việt chuẩn.
  • Các LLM có thể hoạt động tốt trên tiếng Việt chuẩn nhưng lại suy giảm chất lượng đáng kể khi xử lý đầu vào chứa yếu tố phương ngữ.
  • Hiện tại, số lượng nghiên cứu đánh giá một cách hệ thống độ bền vững của LLM trước biến thể phương ngữ tiếng Việt còn rất hạn chế.

Giải pháp

  • Thu thập và xây dựng bộ dữ liệu kiểm thử chứa các câu, đoạn văn mang đặc trưng phương ngữ, gắn với các tác vụ NLP cụ thể.
  • Lựa chọn một tập các LLM đại diện để đánh giá song song trên cùng bộ dữ liệu chuẩn và bộ dữ liệu phương ngữ.
  • Đo lường và so sánh hiệu năng giữa đầu vào chuẩn và đầu vào phương ngữ trên từng tác vụ, sử dụng các thang đo phù hợp.

Mục tiêu

  • Xây dựng một khung đánh giá có hệ thống nhằm đo lường mức độ suy giảm hiệu năng của các LLM phổ biến khi đầu vào chứa các biến thể phương ngữ tiếng Việt, thông qua một tập các tác vụ cụ thể.
  • Huấn luyện một mô hình dịch dựa trên kiến trúc mBART có khả năng chuyển đổi văn bản chứa phương ngữ sang tiếng Việt chuẩn, nhằm giảm thiểu ảnh hưởng tiêu cực của biến thể phương ngữ khi sử dụng các LLM.
  • Cung cấp cơ sở dữ liệu và kết quả thực nghiệm làm tài liệu tham khảo cho cộng đồng nghiên cứu xử lý ngôn ngữ tự nhiên tiếng Việt.

Ứng dụng

  • Đánh giá và lựa chọn mô hình cho doanh nghiệp.
  • Tổng đài chăm sóc khách hàng tự động.
  • Giáo dục và bảo tồn ngôn ngữ.

Thành viên

Giảng viên hướng dẫn: Trần Tạ Quang Minh, Trần Hải Nam, Châu Nguyễn Tố Trinh, Đặng Cao Cường, Nguyễn Thành Luân, Hoàng Minh Đức

Thành viên nhóm: Đặng Thị Ngọc Ánh, Nguyễn Hà Phương, Nguyễn Nhật Anh, Nguyễn Quang Lý, Nguyễn Thanh Tú

Phỏng vấn thành viên dự án

Nguyễn Thanh Tú

Học viên SEAS 2026

Nguyễn Thanh Tú

Quá trình hoàn thiện dự án của nhóm bạn diễn ra như thế nào? Có kỉ niệm nào đáng nhớ không?

Quá trình hoàn thiện dự án của nhóm có thể được đúc kết trọn vẹn qua ba từ: Đoàn kết, Nỗ lực và Bình tĩnh. Suốt chặng đường dài, sự đồng lòng và cố gắng không ngừng nghỉ của từng thành viên chính là động lực lớn nhất giúp cả đội tiến về phía trước.

Kỷ niệm đáng nhớ và "đau tim" nhất chắc chắn là buổi sáng ngày thuyết trình. Ban đầu, mọi thứ diễn ra không hề suôn sẻ và hoàn toàn chệch khỏi những dự tính và mong muốn của nhóm. Tuy nhiên, đối mặt với sự cố đó, thay vì hoảng loạn, toàn đội đã giữ vững sự bình tĩnh để cùng nhau tháo gỡ. Trải nghiệm ngoài ý muốn này không những không làm khó được nhóm mà ngược lại, nó còn trở thành cơ hội tuyệt vời để bộc lộ rõ khả năng giải quyết vấn đề linh hoạt. Sự nhạy bén và tinh thần bọc lót cho nhau trước những tình huống phát sinh bất ngờ đã giúp nhóm lật ngược thế cờ. Đó thực sự là một bài học thực tế quý giá và là minh chứng rõ nét nhất cho sức mạnh của sự đoàn kết.

Sau khi hoàn thành dự án, bạn học hỏi được điều gì, và có dự định gì cho tương lai không?

Nhìn lại hành trình đã qua, bọn em đặt niềm tin rất lớn vào tầm nhìn dài hạn của sản phẩm khi nó hoàn toàn hội tụ đủ tiềm năng để vươn mình trở thành một nền tảng lõi vững chắc, tạo đà bứt phá cho các ứng dụng AI giao tiếp tại Việt Nam trong các lĩnh vực như trợ lý ảo, chăm sóc khách hàng, y tế hay giáo dục,... . Hơn thế nữa, chúng em tâm niệm rằng giá trị cốt lõi và to lớn nhất mà dự án mang lại cho cộng đồng không phải là việc tạo ra một "cỗ máy biết tuốt" khô khan, mà là kiến tạo nên một "người bạn" đồng hành thực thụ, một trí tuệ nhân tạo đủ tinh tế để thấu hiểu và trân trọng bản sắc của mỗi con người. Khép lại chặng đường này, điều quý giá nhất mà mỗi cá nhân học hỏi được chính là sự trưởng thành trong kỹ năng làm việc nhóm gắn kết, cùng bản lĩnh ứng biến và giải quyết mọi vấn đề phát sinh một cách vô cùng linh hoạt.

Câu hỏi thường gặp

Động lực nghiên cứu: người Việt ở các vùng khác nhau có thể nói cùng một ý nhưng dùng từ hoàn toàn khác nhau, trong khi LLM thường chỉ được đánh giá trên tiếng Việt chuẩn. Từ đó, nhóm đặt ra câu hỏi: Nếu ý nghĩa không đổi mà chỉ thay cách diễn đạt theo phương ngữ, liệu LLM có còn đưa ra cùng một quyết định hay không? Đây không chỉ là bài toán ngôn ngữ, mà còn liên quan trực tiếp đến độ tin cậy và khả năng phục vụ công bằng người dùng ở các vùng miền.

Trần Tạ Quang Minh – Trợ giảng

Dự án dựa trên ba mảng chính: Large Language Models, NLP evaluation và robustness/fairness. Nhóm xây dựng VialectBench, một benchmark gồm 400 câu gốc và 2.400 phiên bản phương ngữ được con người viết lại, trải trên 6 nhóm phương ngữ và 4 bài toán: Emotion Recognition, NLI, QA và MCQA. Điểm quan trọng là nhãn, đáp án và bằng chứng được giữ nguyên; chỉ phần ngôn ngữ mang tính phương ngữ được thay đổi, nhờ đó có thể cô lập ảnh hưởng của phương ngữ lên mô hình.

Nhóm sau đó đánh giá 10 LLM khác nhau, từ Qwen, Llama, Mistral, Gemma, Vistral, SeaLLM đến GPT-4o.

Trần Tạ Quang Minh – Trợ giảng

Các bạn học sinh cần phải hiểu được dataset, tiến hành chạy đánh giá trên các mô hình ngôn ngữ, tạo visualization, phân tích insights và propose phương pháp để cải thiện.

Trần Tạ Quang Minh – Trợ giảng

TA đã chuẩn bị dataset, tài liệu hướng dẫn và môi trường phát triển. Học viên đã tự thực hiện việc tiền xử lý dữ liệu, chạy thử nghiệm mô hình, phân tích kết quả và viết báo cáo.

Trần Tạ Quang Minh – Trợ giảng

VIDEO THUYẾT TRÌNH DỰ ÁN

SLIDES DỰ ÁN