SƠ ĐỒ KIẾN THỨC GIÁO TRÌNH
Computer Vision - Thị giác máy tính
Computer Vision
12 MODULE · 34 điểm kiến thức. Chú thích năng lực: A bắt buộc/thành thạo B tìm hiểu/nâng cao
MODULE 1 · Thu thập thông tin thị giác
Điểm kiến thức 1 Sự hình thành ảnh theo phép đo sáng (photometry)
NỘI DUNG CHÍNH
- Chiếu sáng và các loại nguồn sáng
- Mô hình phản xạ và bóng
- Tạo ảnh bằng thấu kính lồi và các nội dung liên quan
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu các mô hình nguồn sáng điểm, đường và mặt A
- Hiểu hàm phân bố phản xạ hai hướng (BRDF – Bidirectional Reflectance Distribution Function) A
- Tìm hiểu các mô hình phản xạ và bóng khác nhau B
- Hiểu quá trình tạo ảnh bằng thấu kính lồi, quang sai màu (chromatic aberration) và hiện tượng tối góc (vignetting) A
Điểm kiến thức 2 Thu nhận ảnh độ sâu và đám mây điểm (depth image & point cloud)
NỘI DUNG CHÍNH
- Các phương thức thu nhận ảnh độ sâu và phân loại thiết bị
- Nguyên lý hoạt động và hướng phát triển của camera độ sâu
- Nguyên lý hoạt động của LiDAR và ứng dụng trong lái xe tự hành
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Có thể nắm được cách phân loại và nguyên lý của camera độ sâu B
- Có thể nắm được ứng dụng của LiDAR B
MODULE 2 · Xử lý ảnh và video
Điểm kiến thức 1 Toán tử xử lý ảnh cục bộ
NỘI DUNG CHÍNH
- Các phương pháp biến đổi hình thái học (morphological transformation) thường gặp
- Bộ lọc tuyến tính ảnh và tác dụng của chúng
- Các thao tác làm sắc nét và làm mờ ảnh
- Định nghĩa và tính chất của biến đổi khoảng cách (distance transform)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu khái niệm và tính chất của biến đổi hình thái học (morphological transformation) A
- Tìm hiểu quy trình thuật toán của bộ lọc tuyến tính, thao tác làm sắc nét và làm mờ ảnh, biến đổi khoảng cách (distance transform), v.v. A
Điểm kiến thức 2 Toán tử xử lý ảnh toàn cục
NỘI DUNG CHÍNH
- Định nghĩa và tính chất của biến đổi Fourier và biến đổi Fourier ngược
- Các phương pháp nội suy ảnh điển hình
- Các phương pháp tăng cường ảnh thường gặp (biến đổi hình học, cân bằng histogram, biến đổi không gian màu)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu khái niệm và tính chất của biến đổi Fourier A
- Tìm hiểu nguyên lý và hiệu quả của các phương pháp nội suy ảnh và tăng cường ảnh điển hình A
- Có thể viết mã để thực hiện biến đổi Fourier hai chiều B
- Có thể viết mã để thực hiện các phương pháp tăng cường ảnh thường gặp B
Điểm kiến thức 3 Các phương pháp tăng cường dữ liệu ảnh điển hình (data augmentation)
NỘI DUNG CHÍNH
- Các phép biến đổi ảnh ngẫu nhiên thường gặp (biến đổi affine ngẫu nhiên, cắt và dán ảnh ngẫu nhiên (random crop & paste), biến đổi độ sáng/sắc độ/độ bão hòa ngẫu nhiên)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu nguyên lý cơ bản của các phép biến đổi ảnh ngẫu nhiên thường gặp A
- Có thể thực hiện các phương pháp biến đổi ảnh ngẫu nhiên đơn giản A
MODULE 3 · Trích xuất đặc trưng thị giác
Điểm kiến thức 1 Trích xuất đặc trưng điểm và khối
NỘI DUNG CHÍNH
- Định nghĩa hàm tự tương quan (autocorrelation function) và ma trận tự tương quan (autocorrelation matrix)
- Nguyên lý cơ bản và ưu điểm của triệt tiêu phi cực đại thích ứng (ANMS – Adaptive Non-Maximum Suppression)
- Phương pháp tính toán bộ mô tả SIFT
- Phương pháp tính toán và ưu điểm của biểu đồ tần suất vị trí–hướng gradient (GLOH)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu khái niệm hàm tự tương quan (autocorrelation function) và ma trận tự tương quan (autocorrelation matrix) A
- Nắm được nguyên lý cơ bản của triệt tiêu phi cực đại thích ứng (ANMS – Adaptive Non-Maximum Suppression) A
- Thành thạo phương pháp tính toán SIFT và GLOH A
Điểm kiến thức 2 Trích xuất đặc trưng biên
NỘI DUNG CHÍNH
- Phương pháp tính toán và phạm vi áp dụng của một số toán tử trích xuất biên
- Các phương pháp chủ yếu và khó khăn trong liên kết biên
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Thành thạo phương pháp tính toán của một số toán tử trích xuất biên A
- Tìm hiểu các phương pháp chủ yếu để liên kết biên A
Điểm kiến thức 3 Trích xuất đặc trưng hình dạng
NỘI DUNG CHÍNH
- Nguyên lý và quy trình của biến đổi Hough
- Định nghĩa và ứng dụng của điểm tụ
- Các dạng mở rộng của biến đổi Hough
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu và nắm vững biến đổi Hough cùng các biến thể của nó A
- Hiểu khái niệm và ứng dụng của điểm tụ A
Điểm kiến thức 4 Trích xuất đặc trưng ngữ nghĩa
NỘI DUNG CHÍNH
- Khái niệm cơ bản và phương pháp phân tích phân biệt tuyến tính (LDA – Linear Discriminant Analysis)
- Khái niệm cơ bản và phương pháp máy vector hỗ trợ (SVM)
- Cấu trúc cơ bản của mạng neuron tích chập (CNN)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Nắm vững phân tích phân biệt tuyến tính (LDA – Linear Discriminant Analysis) và phương pháp tính toán của nó A
- Nắm vững máy vector hỗ trợ (SVM) và phép chuyển đổi mục tiêu tối ưu hóa của nó A
- Hiểu và ghi nhớ cấu trúc cơ bản của mạng neuron tích chập (CNN) A
MODULE 4 · Đăng ký đặc trưng thị giác
Điểm kiến thức 1 Phân loại và các kỹ thuật thường dùng trong so khớp đặc trưng thị giác
NỘI DUNG CHÍNH
- So khớp đặc trưng truyền thống
- Ước lượng luồng quang (optical flow estimation)
- Ước lượng luồng cảnh (scene flow estimation)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản về so khớp đặc trưng thị giác A
- Thành thạo các phương pháp thực hiện so khớp đặc trưng thị giác A
Điểm kiến thức 2 Phân loại và các kỹ thuật thường dùng trong đăng ký đặc trưng thị giác
NỘI DUNG CHÍNH
- Đăng ký hình học truyền thống (geometric registration)
- Đăng ký dựa trên học sâu (deep learning-based registration)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản về đăng ký đặc trưng thị giác A
- Thành thạo các phương pháp thực hiện đăng ký đặc trưng thị giác A
MODULE 5 · Tái tạo cảnh ba chiều
Điểm kiến thức 1 Các khái niệm cơ bản về tái tạo cảnh ba chiều
NỘI DUNG CHÍNH
- Định nghĩa tái tạo cảnh ba chiều
- Lý thuyết và phép tính tam giác hóa (triangulation)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản và cơ sở lý thuyết liên quan đến tái tạo cảnh ba chiều A
Điểm kiến thức 2 Tái tạo ba chiều thưa (Sparse 3D Reconstruction)
NỘI DUNG CHÍNH
- Định nghĩa cấu trúc từ chuyển động (Structure from Motion – SfM)
- Mô hình hóa toán học chuyển động camera và biến đổi tư thế
- Biến đổi tuyến tính trực tiếp (DLT – Direct Linear Transformation) và phương pháp bình sai chùm tia (Bundle Adjustment – BA)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu mối quan hệ biến đổi tư thế giữa nhiều khung hình A
- Nắm vững ràng buộc hình học đối cực (epipolar constraint) và giải chuyển động tư thế của camera A
Điểm kiến thức 3 Tái tạo ba chiều dày đặc (Dense 3D Reconstruction)
NỘI DUNG CHÍNH
- Ý tưởng và đặc điểm của các phương pháp tái tạo ba chiều dày đặc chủ đạo
- Cơ sở lý thuyết của các phương pháp hình học truyền thống
- Cách triển khai thuật toán của các phương pháp học sâu
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Nắm vững cơ sở toán học của hình học lập thể đa góc nhìn (Multi-View Stereo – MVS) A
- Nắm vững khung mô hình của ước lượng độ sâu (depth estimation), trường bức xạ neuron (NeRF) và tái tạo bề mặt (surface reconstruction) A
MODULE 6 · Kỹ thuật nhận dạng đối tượng
Điểm kiến thức 1 Máy vector hỗ trợ (SVM – Support Vector Machine)
NỘI DUNG CHÍNH
- Giải máy vector hỗ trợ tuyến tính (vector pháp tuyến w (normal vector) và hệ số chặn b (bias))
- Giải máy vector hỗ trợ phi tuyến (hàm nhân (kernel function) φ)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản liên quan đến máy vector hỗ trợ A
- Thành thạo quy trình giải máy vector hỗ trợ tuyến tính và máy vector hỗ trợ phi tuyến A
Điểm kiến thức 2 Bộ phân loại Bayes
NỘI DUNG CHÍNH
- Định lý Bayes
- Ứng dụng của bộ phân loại Bayes ngây thơ (Naive Bayes classifier)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản liên quan đến định lý Bayes A
- Thành thạo quy trình huấn luyện bộ phân loại Bayes ngây thơ (Naive Bayes) A
Điểm kiến thức 3 Nhận dạng đối tượng dựa trên học sâu
NỘI DUNG CHÍNH
- Định nghĩa mạng neuron tích chập
- Cơ chế tự chú ý (self-attention)
- Mô hình ngôn ngữ–thị giác (vision-language model)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản liên quan đến mạng neuron tích chập A
- Hiểu cơ chế tự chú ý (self-attention) A
- Hiểu mô hình ngôn ngữ–thị giác (vision-language model) A
MODULE 7 · Phân đoạn ngữ nghĩa thị giác
Điểm kiến thức 1 Mô hình phân đoạn ngữ nghĩa thị giác
NỘI DUNG CHÍNH
- Phân đoạn ảnh hai chiều
- Phân đoạn video theo thời gian
- Phân đoạn đám mây điểm ba chiều
- Phân đoạn xuyên phương thức (cross-modal segmentation)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Nắm được quá trình phát triển và các mô hình kinh điển của phân đoạn ảnh hai chiều A
- Nắm được các loại phương pháp kinh điển trong phân đoạn video theo thời gian A
- Nắm được các loại phương pháp kinh điển trong phân đoạn đám mây điểm ba chiều A
- Tìm hiểu các khái niệm liên quan và phương pháp cơ bản tiên tiến của phân đoạn xuyên phương thức B
Điểm kiến thức 2 Phương pháp huấn luyện phân đoạn ngữ nghĩa thị giác
NỘI DUNG CHÍNH
- Các loại nhiệm vụ phân đoạn thị giác (phân đoạn ngữ nghĩa (semantic segmentation), phân đoạn thực thể (instance segmentation), phân đoạn toàn cảnh (panoptic segmentation))
- Phương pháp huấn luyện phân đoạn bán giám sát (semi-supervised)
- Phương pháp huấn luyện phân đoạn không giám sát (unsupervised)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Nắm vững các chỉ số đánh giá của những loại nhiệm vụ khác nhau A
- Tìm hiểu các phương pháp huấn luyện phân đoạn bán giám sát thường gặp và các mô hình kinh điển B
- Tìm hiểu các phương pháp huấn luyện phân đoạn không giám sát thường gặp và các mô hình kinh điển B
MODULE 8 · Phát hiện đối tượng thị giác
Điểm kiến thức 1 Định nghĩa phát hiện đối tượng
NỘI DUNG CHÍNH
- Định nghĩa nhiệm vụ và dạng đầu ra của phát hiện đối tượng
- Nền tảng kỹ thuật của các phương pháp phát hiện đối tượng truyền thống
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các khái niệm cơ bản và mục đích của phát hiện đối tượng A
- Tìm hiểu vai trò và tầm quan trọng của phát hiện đối tượng trong các ứng dụng khác nhau A
- Tìm hiểu các phương pháp phát hiện đối tượng truyền thống B
Điểm kiến thức 2 Phát hiện đối tượng hai chiều
NỘI DUNG CHÍNH
- Quy trình làm việc của kỹ thuật phát hiện đối tượng hai chiều, bao gồm đề xuất đối tượng (region proposal), trích xuất đặc trưng, phân loại và hồi quy hộp giới hạn (bounding box regression)
- Các chỉ số đánh giá như độ chính xác (precision), độ phủ (recall), AP (độ chính xác trung bình) và mAP (mean Average Precision)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Nắm được nguyên lý cơ bản và các khung thường gặp của thuật toán phát hiện đối tượng hai chiều (như dòng R-CNN, SSD, YOLO) B
- Có thể giải thích và sử dụng các chỉ số đánh giá của phát hiện đối tượng hai chiều A
Điểm kiến thức 3 Phát hiện đối tượng ba chiều
NỘI DUNG CHÍNH
- Đặc điểm của dữ liệu đám mây điểm ba chiều và ứng dụng của nó trong phát hiện đối tượng
- Các kiến trúc mạng thường dùng để xử lý dữ liệu đám mây điểm, như PointNet và PointNet++
- Bối cảnh ứng dụng của phát hiện đối tượng ba chiều nhìn bao quanh (surround-view) và phát hiện đối tượng ba chiều đa phương thức; ưu, nhược điểm của từng phương thức
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu các thuật toán thường gặp để phát hiện đối tượng trong đám mây điểm B
- Tìm hiểu ứng dụng và yêu cầu kỹ thuật của phát hiện đối tượng ba chiều trong các bối cảnh như lái xe tự hành A
- Tìm hiểu kỹ thuật hợp nhất dữ liệu và thuật toán phát hiện đa phương thức B
- Có thể nhận biết các bối cảnh và ứng dụng phù hợp với phát hiện đa phương thức A
MODULE 9 · Theo dõi đối tượng thị giác
Điểm kiến thức 1 Phương pháp theo dõi đối tượng tất định (deterministic tracking)
NỘI DUNG CHÍNH
- Phương pháp theo dõi dựa trên so khớp đặc trưng
- Phương pháp theo dõi dựa trên đối sánh thống kê vùng (region statistics matching)
- Phương pháp theo dõi dựa trên so khớp mẫu
- Phương pháp theo dõi dựa trên Mean-Shift
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu nguyên lý cốt lõi của phương pháp theo dõi đối tượng tất định A
- Tìm hiểu quy trình cơ bản của các thuật toán theo dõi đối tượng dựa trên so khớp đặc trưng/đối sánh thống kê vùng/so khớp mẫu/Mean-Shift A
Điểm kiến thức 2 Phương pháp theo dõi đối tượng phi tất định (stochastic tracking)
NỘI DUNG CHÍNH
- Theo dõi đối tượng thị giác dựa trên bộ lọc Kalman
- Theo dõi đối tượng thị giác dựa trên bộ lọc hạt (particle filter)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu nguyên lý cốt lõi của phương pháp theo dõi đối tượng phi tất định A
- Tìm hiểu quy trình cơ bản của các thuật toán theo dõi đối tượng dựa trên bộ lọc Kalman/bộ lọc hạt A
Điểm kiến thức 3 Phương pháp theo dõi đối tượng thị giác dựa trên học sâu
NỘI DUNG CHÍNH
- Theo dõi bằng bộ lọc tương quan sâu (deep correlation filter)
- Bộ theo dõi sâu dựa trên phân loại
- Thuật toán theo dõi bằng mạng hai nhánh (Siamese network)
- Thuật toán theo dõi sâu dựa trên tối ưu hóa gradient
- Phương pháp theo dõi sâu dựa trên Transformer
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu nguyên lý cơ bản của các phương pháp theo dõi đối tượng thị giác dựa trên học sâu thường gặp A
- Có thể lập trình để thực hiện thuật toán theo dõi đối tượng thị giác sâu đơn giản B
MODULE 10 · Truy xuất nội dung thị giác
Điểm kiến thức 1 Phương pháp truy xuất nội dung thị giác truyền thống
NỘI DUNG CHÍNH
- Mục tiêu và cách phân loại truy xuất thị giác (truy xuất thị giác dựa trên văn bản (text-based retrieval) và truy xuất thị giác dựa trên nội dung (CBIR – Content-Based Image Retrieval))
- Quy trình cơ bản của truy xuất nội dung thị giác
- Phương pháp tìm kiếm láng giềng gần nhất xấp xỉ (ANN – Approximate Nearest Neighbor)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Nắm vững mục tiêu và quy trình cơ bản của truy xuất nội dung thị giác
- Hiểu cây K-D và phương pháp tìm kiếm băm trong các phương pháp tìm kiếm láng giềng gần nhất xấp xỉ
Điểm kiến thức 2 Phương pháp truy xuất nội dung thị giác dựa trên học sâu
NỘI DUNG CHÍNH
- Quy trình chung của các phương pháp truy xuất dựa trên học sâu
- Phương pháp truy xuất ảnh dựa trên học độ đo sâu (deep metric learning) (hàm mất mát, học tổ hợp, lấy mẫu, v.v.)
- Phương pháp truy xuất ảnh dựa trên biểu diễn băm sâu (deep hashing) (có giám sát, không giám sát, v.v.)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu các hướng nghiên cứu và phương pháp kinh điển trong học độ đo sâu (deep metric learning)
- Hiểu các phương pháp kinh điển có giám sát và không giám sát của biểu diễn băm sâu (deep hashing)
MODULE 11 · Sinh nội dung thị giác
Điểm kiến thức 1 Mạng sinh đối kháng (GAN – Generative Adversarial Network)
NỘI DUNG CHÍNH
- Định nghĩa và nguyên lý cơ bản
- Các mô hình biến thể của GAN
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu nguyên lý và nắm được các phép suy diễn đơn giản A
- Biết cách gọi các mô hình mạng sinh đối kháng (GAN) có sẵn A
- Biết cách triển khai và huấn luyện mô hình GAN đơn giản B
Điểm kiến thức 2 Bộ tự mã hóa biến phân (VAE – Variational Autoencoder)
NỘI DUNG CHÍNH
- Định nghĩa và nguyên lý cơ bản
- Các mô hình biến thể của VAE
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu nguyên lý và nắm được các phép suy diễn đơn giản A
- Biết cách gọi các mô hình VAE có sẵn A
- Biết cách triển khai và huấn luyện mô hình VAE đơn giản B
Điểm kiến thức 3 Mô hình tự hồi quy (Autoregressive Model)
NỘI DUNG CHÍNH
- Định nghĩa và nguyên lý cơ bản
- Các mô hình biến thể của mô hình autoregressive
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu nguyên lý và nắm được các phép suy diễn đơn giản A
- Biết cách gọi các mô hình tự hồi quy (autoregressive) có sẵn A
- Biết cách triển khai và huấn luyện mô hình tự hồi quy (autoregressive) đơn giản B
MODULE 12 · Các hướng tiên tiến của thị giác máy tính
Điểm kiến thức 1 Transformer thị giác (Vision Transformer – ViT)
NỘI DUNG CHÍNH
- Kiến trúc chính và các module cơ bản của Transformer
- Khái niệm cơ bản về cơ chế chú ý đa đầu (multi-head attention)
- Khái niệm cơ bản về module chú ý chéo (cross-attention)
- Kiến trúc chính và các module cơ bản của ViT
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Hiểu kiến trúc cơ bản và các module cấu thành của ViT A
- Nắm vững nguyên lý cơ bản của cơ chế chú ý A
Điểm kiến thức 2 Mô hình lớn đa phương thức (Multimodal Large Model)
NỘI DUNG CHÍNH
- Kiến trúc chính và các khái niệm cơ bản của GPT
- Kiến trúc chính và các khái niệm cơ bản của CLIP
- Kiến trúc chính và các khái niệm cơ bản của BLIP
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu khái niệm và tính chất của một số mô hình lớn đa phương thức A
- Có thể sử dụng các mô hình CLIP và BLIP để trích xuất đặc trưng A
Điểm kiến thức 3 Mô hình sinh
NỘI DUNG CHÍNH
- Một số loại mô hình sinh thường gặp
- Kiến trúc chính và các khái niệm cơ bản của mô hình sinh khuếch tán (diffusion model)
YÊU CẦU (MỤC TIÊU NĂNG LỰC)
- Tìm hiểu các mô hình sinh thường gặp A
- Có thể thực hiện phương pháp sinh ảnh đơn giản dựa trên mô hình khuếch tán (diffusion model) A
DỰ ÁN THỰC HÀNH – THÍ NGHIỆM MÔN HỌC
Computer Vision - Thị giác máy tính
Computer Vision · 10 bài thí nghiệm
THÍ NGHIỆM 1 · Cảnh báo thông minh khi xe chệch làn đường
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững các nguyên lý và phương pháp cơ bản của xử lý ảnh (image processing) và học máy (machine learning), bao gồm phân đoạn ảnh (image segmentation), phát hiện biên (edge detection), trích xuất đặc trưng (feature extraction), huấn luyện bộ phân loại, v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống cảnh báo thông minh khi xe chệch làn đường. Đầu vào là hình ảnh đường sá theo thời gian thực do camera phía trước ô tô ghi lại; đầu ra là tín hiệu cảnh báo cho biết xe có chệch làn đường hay không.
CÁC MODULE THUẬT TOÁN
- 1. Tiền xử lý ảnh (Image preprocessing). Chuyển ảnh đường sá đầu vào sang thang xám và khử nhiễu.
- 2. Phát hiện biên (Edge detection). Sử dụng thuật toán phát hiện biên Canny để trích xuất biên đường.
- 3. Phát hiện vạch làn đường (Lane detection). Sử dụng biến đổi Hough để phát hiện các vạch làn đường trong ảnh.
- 4. Phát hiện chệch làn đường (Lane departure detection). Dựa trên mối quan hệ vị trí giữa các vạch làn đường đã phát hiện và phương tiện để xác định phương tiện có chệch làn hay không, đồng thời phát tín hiệu cảnh báo.
THÍ NGHIỆM 2 · Nhận dạng biểu cảm khuôn mặt
MỤC ĐÍCH THÍ NGHIỆM
Tìm hiểu và vận dụng các kỹ thuật phát hiện và nhận dạng khuôn mặt (face detection and recognition), bao gồm định vị các điểm đặc trưng trên khuôn mặt (facial landmark), trích xuất đặc trưng, huấn luyện và kiểm tra bộ phân loại, v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống nhận dạng biểu cảm khuôn mặt. Đầu vào là ảnh khuôn mặt do camera ghi lại; đầu ra là loại biểu cảm được nhận dạng (như vui vẻ, buồn bã, tức giận, v.v.).
CÁC MODULE THUẬT TOÁN
- 1. Phát hiện khuôn mặt (Face detection). Sử dụng bộ phân loại tầng (cascade) dựa trên đặc trưng Haar hoặc MTCNN để phát hiện vùng khuôn mặt.
- 2. Định vị điểm đặc trưng (Landmark detection). Sử dụng Dlib hoặc các thuật toán khác để định vị các điểm mốc trên khuôn mặt.
- 3. Trích xuất đặc trưng biểu cảm (Expression feature extraction). Dựa trên các điểm đặc trưng đã định vị, sử dụng các phương pháp như HOG và LBP để trích xuất đặc trưng biểu cảm.
- 4. Phân loại biểu cảm (Expression classification). Sử dụng SVM hoặc phương pháp học sâu để phân loại các đặc trưng đã trích xuất và xác định loại biểu cảm.
THÍ NGHIỆM 3 · Tái tạo ảnh siêu phân giải
MỤC ĐÍCH THÍ NGHIỆM
Tìm hiểu ứng dụng của xử lý ảnh (image processing) và học sâu (deep learning) trong siêu phân giải ảnh (image super-resolution), bao gồm nội suy ảnh, huấn luyện và kiểm tra mạng neuron tích chập (CNN), v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống tái tạo ảnh siêu phân giải. Đầu vào là ảnh có độ phân giải thấp; đầu ra là ảnh có độ phân giải cao.
CÁC MODULE THUẬT TOÁN
- 1. Nội suy ảnh (Image interpolation). Sử dụng phương pháp nội suy song khối (bicubic) để phóng to sơ bộ ảnh có độ phân giải thấp.
- 2. Trích xuất đặc trưng (Feature extraction). Sử dụng mạng neuron tích chập (CNN, như SRCNN) để trích xuất các đặc trưng chi tiết tần số cao của ảnh.
- 3. Tái tạo ảnh (Image reconstruction). Dựa trên các đặc trưng tần số cao đã trích xuất, tái tạo ảnh có độ phân giải cao thông qua lớp giải chập (deconvolution).
- 4. Đánh giá chất lượng (Quality evaluation). Sử dụng các chỉ số như PSNR và SSIM để đánh giá chất lượng ảnh tái tạo, đồng thời so sánh với ảnh có độ phân giải cao gốc.
THÍ NGHIỆM 4 · Hệ thống nhận dạng chữ số viết tay
MỤC ĐÍCH THÍ NGHIỆM
Tìm hiểu ứng dụng kết hợp giữa xử lý ảnh (image processing) và học máy (machine learning), bao gồm tiền xử lý ảnh, trích xuất đặc trưng, huấn luyện và kiểm tra bộ phân loại, v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống nhận dạng chữ số viết tay. Đầu vào là ảnh chữ số viết tay; đầu ra là chữ số được nhận dạng.
CÁC MODULE THUẬT TOÁN
- 1. Tiền xử lý ảnh (Image preprocessing). Chuyển ảnh chữ số viết tay đầu vào sang thang xám và nhị phân hóa (binarization).
- 2. Trích xuất đặc trưng (Feature extraction). Sử dụng các phương pháp như HOG, SIFT và SURF để trích xuất đặc trưng ảnh.
- 3. Huấn luyện bộ phân loại (Classifier training). Sử dụng KNN, SVM hoặc mạng neuron tích chập (CNN, như LeNet) để huấn luyện bộ phân loại.
- 4. Nhận dạng chữ số (Digit recognition). Sử dụng bộ phân loại đã huấn luyện để nhận dạng ảnh chữ số viết tay đầu vào và xuất kết quả nhận dạng.
THÍ NGHIỆM 5 · Phát hiện chướng ngại vật trong lái xe tự hành
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững các nguyên lý và phương pháp cơ bản của phát hiện và nhận dạng đối tượng (object detection and recognition), bao gồm tiền xử lý ảnh, trích xuất đặc trưng, huấn luyện và kiểm tra mô hình phát hiện đối tượng, v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống phát hiện chướng ngại vật. Đầu vào là hình ảnh đường sá theo thời gian thực do camera phía trước của xe tự hành ghi lại; đầu ra là vị trí và loại chướng ngại vật được phát hiện.
CÁC MODULE THUẬT TOÁN
- 1. Tiền xử lý ảnh (Image preprocessing). Thực hiện các xử lý như chuẩn hóa đối với ảnh đường sá đầu vào.
- 2. Trích xuất đặc trưng (Feature extraction). Sử dụng mạng neuron tích chập (CNN, như ResNet) hoặc transformer để trích xuất đặc trưng của ảnh.
- 3. Phát hiện chướng ngại vật (Obstacle detection). Sử dụng các mô hình học sâu (deep learning) như YOLO, DETR hoặc Faster R-CNN để phát hiện chướng ngại vật trong ảnh.
- 4. Hiển thị kết quả (Result visualization). Đánh dấu vị trí và loại chướng ngại vật được phát hiện trên ảnh gốc, đồng thời xuất kết quả phát hiện.
THÍ NGHIỆM 6 · Hệ thống phân đoạn ảnh y khoa
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững các nguyên lý và phương pháp cơ bản của xử lý và phân đoạn ảnh y khoa, bao gồm tiền xử lý ảnh, trích xuất đặc trưng, huấn luyện và kiểm tra mô hình phân đoạn, v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống phân đoạn ảnh y khoa. Đầu vào là ảnh quét MRI hoặc CT; đầu ra là các vùng mô hoặc tổn thương sau khi phân đoạn.
CÁC MODULE THUẬT TOÁN
- 1. Tiền xử lý ảnh (Image preprocessing). Khử nhiễu, chuẩn hóa và tăng cường độ tương phản (contrast enhancement) cho ảnh y khoa đầu vào.
- 2. Trích xuất đặc trưng (Feature extraction). Sử dụng mạng neuron tích chập (CNN) và các phương pháp khác để trích xuất đặc trưng sâu của ảnh.
- 3. Phân đoạn ảnh (Image segmentation). Sử dụng các thuật toán phân đoạn ngữ nghĩa (semantic segmentation, như UNet và Mask R-CNN) để phân đoạn ảnh, nhận dạng và đánh dấu các vùng mô hoặc tổn thương khác nhau.
- 4. Hiển thị kết quả (Result visualization). Chồng kết quả phân đoạn lên ảnh gốc và xuất ảnh sau khi phân đoạn.
THÍ NGHIỆM 7 · Nhận dạng đối tượng từ đám mây điểm ba chiều
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững các phương pháp trích xuất đặc trưng đám mây điểm ba chiều (3D point cloud) dựa trên học sâu (deep learning) và tìm hiểu ứng dụng của chúng trong nhiệm vụ nhận dạng đối tượng.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống nhận dạng đối tượng từ đám mây điểm ba chiều. Đầu vào là đối tượng đám mây điểm ba chiều (3D point cloud); đầu ra là kết quả phân loại nhận dạng.
CÁC MODULE THUẬT TOÁN
- 1. Đầu vào đám mây điểm (Point cloud input). Sử dụng các tập dữ liệu ModelNet40, ShapeNet hoặc ScanObjectNN để thu được dữ liệu đám mây điểm đầu vào.
- 2. Trích xuất đặc trưng (Feature extraction). Sử dụng các mạng như PointNet để trích xuất đặc trưng sâu của đám mây điểm.
- 3. Nhận dạng đám mây điểm (Point cloud recognition). Sử dụng các bộ phân loại như Softmax để nhận dạng các đặc trưng đám mây điểm đã trích xuất.
THÍ NGHIỆM 8 · Tăng cường ảnh
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững các loại phương pháp tăng cường ảnh (data augmentation) khác nhau và tìm hiểu ứng dụng của chúng trong huấn luyện mạng.
NỘI DUNG THÍ NGHIỆM
Đối với cùng một tập dữ liệu huấn luyện, sử dụng các phương pháp tăng cường dữ liệu (data augmentation) khác nhau để tăng cường tập dữ liệu, sau đó huấn luyện các mô hình mạng và so sánh kết quả huấn luyện mô hình.
CÁC MODULE THUẬT TOÁN
- 1. Đầu vào ảnh (Image input). Chọn một tập dữ liệu ảnh làm mẫu huấn luyện.
- 2. Tăng cường ảnh (Data augmentation). Lần lượt sử dụng các phương pháp như biến đổi affine ngẫu nhiên, biến đổi độ sáng ngẫu nhiên, cắt và dán ảnh ngẫu nhiên (random crop & paste) để tăng cường ảnh cho các mẫu huấn luyện.
- 3. Huấn luyện mô hình (Model training). Lần lượt sử dụng tập huấn luyện gốc và các tập dữ liệu được tăng cường bằng những phương pháp khác nhau để huấn luyện mô hình mạng, từ đó thu được các mạng đã huấn luyện khác nhau.
- 4. So sánh kết quả (Result comparison). So sánh độ chính xác của các mạng khác nhau trong nhiệm vụ nhận dạng ảnh và phân tích tác dụng của tăng cường ảnh đối với việc huấn luyện mô hình.
THÍ NGHIỆM 9 · Tái tạo cảnh ba chiều
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững phương pháp tái tạo cảnh ba chiều dựa trên cấu trúc từ chuyển động (Structure from Motion – SfM), bao gồm ràng buộc hình học đối cực (epipolar constraint), ước lượng và phân rã ma trận thiết yếu (essential matrix), phép tam giác hóa (triangulation), bài toán PnP và phương pháp giải, v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống tái tạo cảnh ba chiều để thực hiện tái tạo ba chiều thưa (sparse 3D reconstruction) từ các ảnh đa góc nhìn.
CÁC MODULE THUẬT TOÁN
- 1. Đầu vào ảnh (Image input). Chọn các ảnh đa góc nhìn của cảnh làm đầu vào.
- 2. Trích xuất và so khớp đặc trưng (Feature extraction & matching). Trích xuất các đặc trưng như SIFT từ từng ảnh và thực hiện so khớp đặc trưng (feature matching) cho từng cặp ảnh.
- 3. Cấu trúc từ chuyển động (Structure from Motion). Dựa trên các ảnh đầu vào, khôi phục quan hệ tư thế giữa các camera và tiến hành tái tạo.
- 4. Xuất kết quả (Output). Xuất tư thế camera và đám mây điểm ba chiều thưa thu được từ quá trình tái tạo.
THÍ NGHIỆM 10 · Tổng hợp góc nhìn mới
MỤC ĐÍCH THÍ NGHIỆM
Nắm vững phương pháp tổng hợp góc nhìn mới dựa trên trường bức xạ neuron (Neural Radiance Field – NeRF), bao gồm biểu diễn trường ẩn (implicit representation), kết xuất (rendering), dò tia (ray marching), v.v.
NỘI DUNG THÍ NGHIỆM
Phát triển một hệ thống tổng hợp góc nhìn mới dựa trên trường bức xạ neuron; xây dựng trường bức xạ neuron (NeRF) từ các ảnh có góc nhìn đã biết và kết xuất để thu được góc nhìn mới.
CÁC MODULE THUẬT TOÁN
- 1. Đầu vào ảnh (Image input). Chọn các ảnh đa góc nhìn của cảnh làm đầu vào.
- 2. Học trường bức xạ neuron (NeRF Training). Sử dụng các ảnh đa góc nhìn đầu vào để học trường bức xạ neuron (NeRF) và huấn luyện các tham số mô hình.
- 3. Xuất kết quả (Output). Kết xuất ảnh từ một góc nhìn mới cho trước.
- 01Tổng quan môn họcTải về
- 02Thu thập thông tin thị giácTải về
- 03Xử lý hình ảnh và videoTải về
- 04Trích xuất đặc trưng thị giácTải về
- 05Đăng ký đặc trưng thị giácTải về
- 06Tái tạo cảnh ba chiềuTải về
- 07Nhận dạng đối tượng thị giácTải về
- 08Phân đoạn ngữ nghĩa thị giácTải về
- 09Phát hiện đối tượng thị giácTải về
- 10Theo dõi mục tiêu thị giácTải về
- 11Truy xuất nội dung thị giácTải về
- 12Tạo sinh nội dung thị giácTải về
- 13Các hướng nghiên cứu tiên phong của thị giác máy tínhTải về