Vì sao Transformer đã mở đường cho LLM?
Hình trên mô tả một trong những bước ngoặt quan trọng nhất của AI hiện đại: kiến trúc Transformer – nền tảng phía sau phần lớn các Large Language Model (LLM) ngày nay.
LLM – Large Language Model là mô hình AI được thiết kế để xử lý, hiểu và tạo ra ngôn ngữ. Một trong những cơ chế cốt lõi khi sinh văn bản nghe có vẻ rất đơn giản:
Ví dụ khi nhận câu:
mô hình tính xác suất của nhiều token có thể xuất hiện tiếp theo như đẹp, nóng, lạnh, tốt... rồi lựa chọn token theo chiến lược sinh phù hợp. Sau đó quá trình được lặp lại để tạo thành câu hoàn chỉnh. 5 bước giúp Transformer xử lý ngôn ngữ
1. Tokenization – Chia văn bản thành token
LLM không trực tiếp nhìn câu chữ giống con người. Văn bản trước tiên được tokenizer chuyển thành các đơn vị nhỏ gọi là token. Token có thể là một từ, một phần của từ, dấu câu hoặc ký hiệu.
2. Token Embeddings – Biến token thành vector
Máy tính cần con số để tính toán. Vì vậy mỗi token được biểu diễn thành một vector nhiều chiều, giúp mô hình học được các quan hệ ngữ nghĩa giữa chúng. Thông tin về vị trí/thứ tự token cũng cần được đưa vào mô hình.
3. Multi-Head Attention – Xác định điều gì cần chú ý
Đây là một trong những ý tưởng quan trọng nhất của Transformer.
Xét câu:
Để xử lý từ “nó”, mô hình cần nhận ra rằng từ này liên quan mạnh tới “Router”.
Attention giúp mô hình đánh giá quan hệ giữa các token. Multi-Head Attention cho phép nhiều "đầu attention" cùng học những kiểu quan hệ khác nhau trong ngữ cảnh.
Đây cũng chính là nguồn gốc tên bài báo nổi tiếng năm 2017:
Công trình này giới thiệu kiến trúc Transformer và trở thành một cột mốc quan trọng dẫn tới sự phát triển của LLM.
4. Feed Forward Neural Network – Xử lý sâu hơn
Sau Attention, thông tin tiếp tục đi qua các mạng neural Feed Forward. Transformer xếp chồng nhiều lớp xử lý như vậy, giúp mô hình xây dựng các biểu diễn ngày càng phong phú về ngữ cảnh.
5. Output – Dự đoán token tiếp theo
Ở đầu ra, mô hình tạo điểm số cho các token có thể xuất hiện tiếp theo. Các bước như Linear + Softmax có thể chuyển chúng thành một phân bố xác suất.
Ví dụ:
"Router đang bị ..."
CPU 38%
quá tải 27%
lỗi 14%
tấn công 7%
...
Một token được chọn, bổ sung vào chuỗi, rồi toàn bộ quá trình tiếp tục:
Token → Attention → Neural Network → Probability → Next Token → Next Token... Một điểm cần lưu ý về hình Transformer
Sơ đồ bên phải là Transformer Encoder–Decoder nguyên bản trong bài báo năm 2017. Tuy nhiên, không phải mọi LLM hiện đại đều sử dụng đầy đủ cả Encoder và Decoder theo đúng sơ đồ này.
Ví dụ, các mô hình GPT nổi tiếng thuộc nhóm decoder-only Transformer, trong khi những kiến trúc khác có thể dùng encoder-only hoặc encoder-decoder.
Vì vậy, khi nói “LLM dự đoán token tiếp theo”, chúng ta đang mô tả rất tốt cơ chế của các autoregressive LLM như dòng GPT, nhưng không nên hiểu rằng mọi mô hình ngôn ngữ đều có kiến trúc hoàn toàn giống nhau. Điều cần nhớ
Nếu bài trước chúng ta đã thấy:
AI → Machine Learning → Deep Learning → Generative AI
thì bây giờ có thể đi sâu thêm một tầng:
Generative AI → LLM → Transformer → Attention → Next-token prediction
Transformer chính là một trong những công nghệ nền tảng đã biến việc “dự đoán token tiếp theo” thành khả năng tạo văn bản, viết code, tóm tắt tài liệu, hỏi đáp và hỗ trợ nhiều tác vụ AI mà chúng ta sử dụng hàng ngày.
Hình trên mô tả một trong những bước ngoặt quan trọng nhất của AI hiện đại: kiến trúc Transformer – nền tảng phía sau phần lớn các Large Language Model (LLM) ngày nay.
LLM – Large Language Model là mô hình AI được thiết kế để xử lý, hiểu và tạo ra ngôn ngữ. Một trong những cơ chế cốt lõi khi sinh văn bản nghe có vẻ rất đơn giản:
Dự đoán token tiếp theo – Predict the next token.
Ví dụ khi nhận câu:
“Hôm nay thời tiết rất…”
mô hình tính xác suất của nhiều token có thể xuất hiện tiếp theo như đẹp, nóng, lạnh, tốt... rồi lựa chọn token theo chiến lược sinh phù hợp. Sau đó quá trình được lặp lại để tạo thành câu hoàn chỉnh. 5 bước giúp Transformer xử lý ngôn ngữ
1. Tokenization – Chia văn bản thành token
LLM không trực tiếp nhìn câu chữ giống con người. Văn bản trước tiên được tokenizer chuyển thành các đơn vị nhỏ gọi là token. Token có thể là một từ, một phần của từ, dấu câu hoặc ký hiệu.
2. Token Embeddings – Biến token thành vector
Máy tính cần con số để tính toán. Vì vậy mỗi token được biểu diễn thành một vector nhiều chiều, giúp mô hình học được các quan hệ ngữ nghĩa giữa chúng. Thông tin về vị trí/thứ tự token cũng cần được đưa vào mô hình.
3. Multi-Head Attention – Xác định điều gì cần chú ý
Đây là một trong những ý tưởng quan trọng nhất của Transformer.
Xét câu:
“Router bị quá tải nên nó bắt đầu drop packet.”
Để xử lý từ “nó”, mô hình cần nhận ra rằng từ này liên quan mạnh tới “Router”.
Attention giúp mô hình đánh giá quan hệ giữa các token. Multi-Head Attention cho phép nhiều "đầu attention" cùng học những kiểu quan hệ khác nhau trong ngữ cảnh.
Đây cũng chính là nguồn gốc tên bài báo nổi tiếng năm 2017:
“Attention Is All You Need.”
Công trình này giới thiệu kiến trúc Transformer và trở thành một cột mốc quan trọng dẫn tới sự phát triển của LLM.
4. Feed Forward Neural Network – Xử lý sâu hơn
Sau Attention, thông tin tiếp tục đi qua các mạng neural Feed Forward. Transformer xếp chồng nhiều lớp xử lý như vậy, giúp mô hình xây dựng các biểu diễn ngày càng phong phú về ngữ cảnh.
5. Output – Dự đoán token tiếp theo
Ở đầu ra, mô hình tạo điểm số cho các token có thể xuất hiện tiếp theo. Các bước như Linear + Softmax có thể chuyển chúng thành một phân bố xác suất.
Ví dụ:
"Router đang bị ..."
CPU 38%
quá tải 27%
lỗi 14%
tấn công 7%
...
Một token được chọn, bổ sung vào chuỗi, rồi toàn bộ quá trình tiếp tục:
Token → Attention → Neural Network → Probability → Next Token → Next Token... Một điểm cần lưu ý về hình Transformer
Sơ đồ bên phải là Transformer Encoder–Decoder nguyên bản trong bài báo năm 2017. Tuy nhiên, không phải mọi LLM hiện đại đều sử dụng đầy đủ cả Encoder và Decoder theo đúng sơ đồ này.
Ví dụ, các mô hình GPT nổi tiếng thuộc nhóm decoder-only Transformer, trong khi những kiến trúc khác có thể dùng encoder-only hoặc encoder-decoder.
Vì vậy, khi nói “LLM dự đoán token tiếp theo”, chúng ta đang mô tả rất tốt cơ chế của các autoregressive LLM như dòng GPT, nhưng không nên hiểu rằng mọi mô hình ngôn ngữ đều có kiến trúc hoàn toàn giống nhau. Điều cần nhớ
Nếu bài trước chúng ta đã thấy:
AI → Machine Learning → Deep Learning → Generative AI
thì bây giờ có thể đi sâu thêm một tầng:
Generative AI → LLM → Transformer → Attention → Next-token prediction
Transformer chính là một trong những công nghệ nền tảng đã biến việc “dự đoán token tiếp theo” thành khả năng tạo văn bản, viết code, tóm tắt tài liệu, hỏi đáp và hỗ trợ nhiều tác vụ AI mà chúng ta sử dụng hàng ngày.