
66b đề cập đến một mô hình ngôn ngữ có khoảng 66 tỷ tham số, nằm ở giữa những mô hình nhỏ và lớn. Nó được thiết kế để cân bằng hiệu năng và chi phí, phù hợp cho nhiều tác vụ NLP như sinh văn bản, tóm tắt, trả lời câu hỏi.
66b thường dựa trên kiến trúc transformer, với nhiều lớp tự attention và feed-forward. Độ sâu và chiều ẩn ảnh hưởng đến khả năng nắm bắt ngữ cảnh và khả năng tổng quát hóa.

Trên các tập dữ liệu đa ngôn ngữ và đa tác vụ, 66b cho thấy hiệu năng cạnh tranh, đặc biệt ở các tác vụ yêu cầu khả năng sinh văn bản và suy luận. Tuy nhiên, chi phí huấn luyện và triển khai vẫn là thách thức...
Việc chọn 66b phản ánh một thỏa hiệp giữa khả năng hiểu ngữ cảnh sâu và chi phí tính toán. Trong thực tế, việc tinh chỉnh và tối ưu triển khai có thể mang lại lợi ích lớn mà không cần tăng tham số.

