Transformer là gì
Kiến trúc mạng nơ-ron với cơ chế chú ý
Transformer là một kiến trúc mạng nơ-ron cách mạng dựa trên cơ chế chú ý (attention), đã thay đổi lĩnh vực xử lý ngôn ngữ tự nhiên và học máy.
Đặc điểm chính
- Self-Attention — cho phép mô hình xem xét mối quan hệ giữa tất cả các phần tử trong chuỗi
- Xử lý song song — khác với RNN, xử lý toàn bộ chuỗi đồng thời
- Mã hóa vị trí — thêm thông tin vị trí cho các phần tử chuỗi
- Multi-Head Attention — nhiều cơ chế chú ý song song
Kiến trúc
- Bộ mã hóa — xử lý chuỗi đầu vào
- Bộ giải mã — tạo chuỗi đầu ra
- Mạng Feed-Forward — các lớp kết nối đầy đủ sau attention
- Chuẩn hóa lớp — chuẩn hóa để ổn định quá trình huấn luyện
Ứng dụng kinh doanh
- Chatbot và Trợ lý — GPT, Claude, Gemini
- Dịch máy — dịch văn bản chất lượng cao
- Phân tích tài liệu — trích xuất thông tin từ văn bản
- Tạo nội dung — tự động tạo văn bản
- Tìm kiếm và Gợi ý — tìm kiếm ngữ nghĩa trong cơ sở dữ liệu