SEAS
Quay về chương trình

SEAS 2026

TÔ MÀU ẢNH TƯ LIỆU LỊCH SỬ MIỀN TRUNG VIỆT NAM BẰNG HỌC SÂU

Di sản kiến trúc cổ tại Huế và Hội An mang giá trị lịch sử vô cùng to lớn, nhưng phần lớn tư liệu còn lưu giữ đều là ảnh đen trắng đã xuống cấp theo thời gian. Để khắc phục việc phục hồi thủ công tốn nhiều công sức, nhóm đã ứng dụng AI và Deep Learning giúp tự động hóa quá trình khôi phục màu sắc, góp phần lưu giữ và lan tỏa giá trị di sản.

Dự án sử dụng mô hình Colorization CNN (ECCV 2016) kết hợp với kỹ thuật tinh chỉnh tham số hiệu quả LoRA (Low-Rank Adaptation) trên không gian màu Lab. Bằng cách giữ nguyên kênh độ sáng (L) và chỉ dự đoán 2 kênh màu (a, b), mô hình vừa tái hiện được sắc vàng đặc trưng của Hội An hay màu mái ngói cổ của Huế, vừa tiết kiệm hơn 90% tham số cần huấn luyện.

Thực nghiệm trên tập dữ liệu hơn 1.000 ảnh di sản cho thấy mô hình sau khi fine-tune bằng LoRA đạt các chỉ số chất lượng vượt trội (tăng PSNR, SSIM và giảm MSE). Kết quả tô màu sinh động, tự nhiên và vượt trội hơn hẳn so với mô hình gốc, giúp giải quyết tốt bài toán tô màu kiến trúc cổ phức tạp.

Nghiên cứu mở ra tiềm năng lớn trong việc phục dựng tư liệu lịch sử, hỗ trợ triển lãm số, truyền thông du lịch và giáo dục văn hóa di sản. Trong tương lai, nhóm hướng tới thử nghiệm các công nghệ tiên tiến hơn như Diffusion Models kết hợp ControlNet và mở rộng dữ liệu ra di sản toàn quốc.

Bối cảnh

  • Di sản kiến trúc lịch sử tại Huế và Hội An mang giá trị văn hóa, nghệ thuật và lịch sử vô cùng to lớn.
  • Phần lớn tài liệu tư liệu cổ còn lưu giữ lại đều ở dạng ảnh đen trắng (grayscale) bị giảm chất lượng theo thời gian.
  • Việc phục hồi màu sắc thủ công tốn rất nhiều thời gian, công sức và đòi hỏi chuyên môn cao.
  • Áp dụng AI và Deep Learning giúp tự động hóa quá trình khôi phục màu sắc, giữ gìn và lan tỏa giá trị di sản tới cộng đồng rộng rãi hơn.

Giải pháp

  • Chuyển đổi bài toán sang không gian màu Lab: Giữ nguyên kênh L (Luminance) từ ảnh đen trắng, sử dụng Model để dự đoán 2 kênh màu a và b (Chrominance)
  • Sử dụng mạng cơ sở Colorization CNN (ECCV 2016) kết hợp Dilation Layers giúp mở rộng trường nhìn (receptive field) để nắm bắt ngữ cảnh kiến trúc tốt hơn
  • Tích hợp LoRA Fine-tuning (Rank r=12): Đóng băng các lớp suy luận gốc, chỉ huấn luyện ma trận tham số bổ trợ A/B nhẹ để thích ứng miền dữ liệu đặc thù Huế/Hội An, tiết kiệm tối đa tài nguyên tính toán
  • So sánh kết quả giữa Base Model và LoRA Model để đánh giá chất lượng quá trình train

Mục tiêu

  • Xây dựng mô hình khôi phục màu sắc tự động (Colorization) tối ưu hóa cho kiến trúc Huế - Hội An bằng cách kết hợp kiến trúc CNN (ECCV 2016) và kỹ thuật tinh chỉnh tham số hiệu quả LoRA (Low-Rank Adaptation)
  • Đảm bảo màu sắc sinh ra tự nhiên, chân thực, tái hiện đúng đặc trưng kiến trúc (tường vàng Hội An, mái ngói cổ, cấu trúc gỗ, di sản Huế) với các chỉ số đo lường vượt trội (tăng PSNR, SSIM và giảm MSE)
  • Phục dựng tư liệu lịch sử, hỗ trợ truyền thông du lịch, giáo dục văn hóa và bảo tồn di sản số

Ứng dụng

  • Bảo tồn & Triển lãm số: Số hóa và tô màu tự động cho các bộ sưu tập ảnh tư liệu di sản, phục vụ triển lãm bảo tàng thực tế ảo/kỹ thuật số
  • Du lịch & Truyền thông: Tạo nguyên liệu truyền thông hình ảnh sinh động cho các chiến dịch quảng bá du lịch Thừa Thiên Huế và Quảng Nam
  • Giáo dục & Nghiên cứu: Hỗ trợ giảng dạy lịch sử, kiến trúc cổ Việt Nam với hình ảnh trực quan, sắc nét
  • Nâng cao hiểu biết về quá trình sử dụng kiến trúc CNN để train model và huấn luyện AI

Thành viên

Giảng viên hướng dẫn: Nguyễn Phúc Lương, Nguyễn Thị Như Quỳnh, Nguyễn Phú Vinh

Thành viên nhóm: Trần Công Đạt, Lương Thị Chi Lan, Trần Đức Phát, Trần Hoàng Tố, Nguyễn Vĩnh Trọng

Phỏng vấn thành viên dự án

Trần Hoàng Tố

Học viên SEAS 2026

Trần Hoàng Tố

Quá trình hoàn thiện dự án của nhóm bạn diễn ra như thế nào? Có kỉ niệm nào đáng nhớ không?

Nếu dùng 3 từ để mô tả hành trình từ lúc được phân chia nhóm đến khi hoàn thành bài thuyết trình, em sẽ chọn từ: Hào hứng, hoang mang, hân hoan.

Trong suốt quá trình làm dự án, khoảnh khắc "Eureka!" (lúc cả nhóm tìm ra lời giải cho bài toán khó nhất) diễn ra sau vô số lần thử và sai. Quá trình train-model rất lâu, nhóm chúng em quan sát cẩn thận các kết quả ứng với từng tham số và cuối cùng tìm ra thông số cho hàm loss thấp nhất có thể. Và kết quả như ý xuất hiện sau hơn 10 tiếng chờ đợi và cầu nguyện vì chúng em đã điều chỉnh, tính toán vô cùng chi tiết.

Nửa đêm trước ngày thuyết trình, có sự cố khiến cả nhóm "đau đầu" chính là giới hạn thời gian. Nhóm chúng em liên tục tập dợt để phần nói êm mượt, trôi chảy, đồng thời cân bằng giữa sự hài hước và kiến thức chuyên môn nhằm giúp bài thú vị và thu hút các bạn hơn. Trong quá trình đó, nhóm em liên tục lố một ít thời gian nên khá lo lắng. Rất vui là cuối cùng bài đã diễn ra thành công, như tính toán và mong đợi.

Nếu chỉ được chọn 1 điểm kỹ thuật hoặc 1 tính năng mà bạn cảm thấy tự hào nhất trong dự án của nhóm, đó sẽ là ứng dụng LoRA, tối ưu hóa mô hình gốc. Bởi vì nhờ vậy, nhóm em có thể tô màu các bức ảnh kiến trúc cổ đen trắng mà không phải tốn quá nhiều tài nguyên huấn luyện mô hình mới từ đầu.

Trước đó, em nghĩ rằng chỉ cần chia tập train/test rồi chạy lệnh. Tuy nhiên, khi bắt tay vào làm dữ liệu rất dễ trùng lặp, không phù hợp và chất lượng kém. Do đó, nhóm em phải làm sạch dữ liệu cẩn thận. Hơn nữa, trước đó em tưởng rằng chỉ cần giảm hàm loss, giải quyết các chỉ số toán học thuần túy là đã thành công. Tuy nhiên, mô hình huấn luyện chính xác cao nhưng tô màu thực tế không đẹp, bị lem cũng rất đáng lo ngại, nên chúng em phải học cách cân bằng các yếu tố.

Sau khi hoàn thành dự án, bạn học hỏi được điều gì, và có dự định gì cho tương lai không?

Em học được cách đặt câu hỏi ngược lại với kết quả của mô hình: nếu loss giảm nhưng ảnh chưa đẹp thì vấn đề nằm ở đâu, ở dữ liệu, cách huấn luyện hay chính objective của bài toán. Điều đó khiến em nhận ra rằng một metric tốt không nhất thiết đồng nghĩa với một sản phẩm tốt, bởi vì những gì con người đánh giá là “đẹp”, “tự nhiên” hay “giống ảnh gốc” đôi khi không thể được phản ánh hoàn toàn bằng một con số.

Nếu có thêm thời gian và ngân sách không giới hạn, tính năng “trong mơ” của em là biến dự án thành một ứng dụng phục chế ảnh dành cho mọi người. Không chỉ tô màu đẹp hơn và tự nhiên hơn cho ảnh kiến trúc, mà có thể xử lý nhiều thể loại ảnh cũ khác nhau, từ ảnh gia đình, ảnh tư liệu lịch sử cho đến phim đen trắng. Ví dụ, các gia đình liệt sĩ hoặc những người đang lưu giữ ảnh của người thân chỉ cần tải ảnh lên và có thể nhận được một phiên bản được phục chế, tô màu rõ nét hơn.

Câu hỏi thường gặp

Mình thường xem những video phục dựng màu cho ảnh chân dung của các thương binh, liệt sĩ được chia sẻ trên mạng xã hội. Mỗi lần xem, mình đều cảm nhận được một điều gì đó rất đặc biệt: màu sắc dường như "thổi hồn" vào những gương mặt vốn chỉ còn lại trong sắc trắng đen, khiến lịch sử trở nên gần gũi và sống động hơn rất nhiều. Nhưng rồi mình nhận ra rằng, không chỉ con người mà cả một giai đoạn bi hùng của đất nước, những con phố, mái nhà, khung cảnh sinh hoạt đời thường ở Huế hay Hội An cũng đang dần phai nhạt cùng với những bức ảnh đen trắng ấy. Những chi tiết màu sắc nguyên bản đã mất đi vĩnh viễn theo thời gian, và thế hệ sau chỉ có thể tưởng tượng chứ không thể thực sự "nhìn thấy" quá khứ theo đúng cách nó đã từng tồn tại. Chính suy nghĩ đó đã thôi thúc mình tìm một phương pháp để phục dựng lại màu sắc cho những bức ảnh lịch sử này, như một cách để kết nối lại với ký ức và bảo tồn hình ảnh của Huế, Hội An trong một giai đoạn đáng nhớ của dân tộc.

Nguyễn Phúc Lương – Trợ giảng

Dự án được xây dựng dựa trên nền tảng kiến thức cơ bản về Computer Vision, trong đó trọng tâm là mạng nơ-ron tích chập (CNN) và kiến trúc Encoder-Decoder, vốn rất phù hợp cho các bài toán chuyển đổi ảnh (image-to-image translation) như tô màu ảnh đen trắng. Bên cạnh đó, nhóm còn áp dụng kỹ thuật LoRA (Low-Rank Adaptation) để tinh chỉnh mô hình một cách hiệu quả mà không cần huấn luyện lại toàn bộ tham số, giúp tiết kiệm tài nguyên tính toán trong khi vẫn đảm bảo chất lượng đầu ra. Ngoài kiến trúc mô hình, dự án còn đòi hỏi hiểu biết về các kỹ thuật và metrics để theo dõi, đánh giá quá trình huấn luyện, từ đó đảm bảo model học đúng hướng.

Nguyễn Phúc Lương – Trợ giảng

Thách thức lớn nhất mà các bạn học viên phải đối mặt là tự mình điều chỉnh các tham số huấn luyện (hyperparameters) và thiết lập cấu hình khởi tạo sao cho model đạt được kết quả tốt nhất trên bộ ảnh inference cho sẵn. Đây là một quá trình đòi hỏi thử nghiệm nhiều lần, quan sát kỹ và điều chỉnh linh hoạt. Không dừng lại ở việc huấn luyện, học viên còn cần chứng minh và giải thích được kết quả của mình theo hai hướng: định tính, thông qua việc trình bày trực quan các bức ảnh đã được tô màu để người xem có thể tự đánh giá; và định lượng, thông qua việc so sánh các thông số, chỉ số đo lường (metrics) giữa các lần thử nghiệm khác nhau để chứng minh sự cải thiện một cách khoa học và có cơ sở.

Nguyễn Phúc Lương – Trợ giảng

Về phía TA, nhóm đã chuẩn bị sẵn một bộ khung sườn (framework) cơ bản để kết nối các thành phần chính của hệ thống lại với nhau, bao gồm model, LoRA adapter, dataset, và pipeline inference. Bộ khung này đóng vai trò như một "bộ khung xương" giúp học viên hình dung được luồng hoạt động tổng thể của dự án.

Về phía học viên, các bạn sẽ tự tay code chi tiết từng module bên trong khung sườn đó, đồng thời tự tinh chỉnh các tham số để tiến hành huấn luyện model. Học viên cũng chủ động tìm kiếm, thu thập và sàng lọc bộ dữ liệu (dataset) phù hợp cho bài toán tô màu ảnh Huế và Hội An. Cuối cùng, các bạn cần tự phối hợp trong nhóm để tổng hợp, trình bày quá trình thực hiện cũng như kết quả đạt được trước ban giám khảo một cách mạch lạc và thuyết phục.

Nguyễn Phúc Lương – Trợ giảng

VIDEO THUYẾT TRÌNH DỰ ÁN

SLIDES DỰ ÁN