Thị giác máy tính là gì
AI để phân tích hình ảnh và video
Thị giác máy tính — lĩnh vực trí tuệ nhân tạo huấn luyện máy tính trích xuất thông tin từ hình ảnh và video.
Nhiệm vụ chính
- Phân loại hình ảnh — nhận dạng đối tượng trong ảnh
- Phát hiện đối tượng — tìm và định vị đối tượng với bounding boxes
- Phân đoạn — gán nhãn hình ảnh theo pixel
- Nhận dạng khuôn mặt — xác định và xác minh người
- OCR — nhận dạng văn bản trong hình ảnh
- Theo dõi đối tượng — tracking trong luồng video
Công nghệ chính
- CNN (mạng tích chập) — nền tảng của CV hiện đại
- YOLO — phát hiện đối tượng thời gian thực
- ResNet, EfficientNet — kiến trúc phân loại
- U-Net, Mask R-CNN — phân đoạn ngữ nghĩa
- Vision Transformers (ViT) — transformers cho hình ảnh
Ứng dụng kinh doanh
- Kiểm soát chất lượng — phát hiện lỗi tự động trong sản xuất
- Bán lẻ — nhận dạng sản phẩm, giám sát kệ hàng, phân tích hàng đợi
- An ninh — giám sát video với nhận dạng khuôn mặt và hành động
- Y tế — phân tích X-ray, MRI, CT để chẩn đoán
- Ô tô — lái tự động và hệ thống ADAS