66B đề cập tới một mô hình ngôn ngữ có khoảng 66 tỷ tham số. Nó nằm trong tầm kích thước giữa các mô hình nhỏ và lớn, cho phép hiểu và sinh văn bản với độ mượt mà cao. Việc tăng tham số thường đi kèm với yêu cầu tính toán và dữ liệu lớn hơn.
Người ta thường xếp các mô hình ngôn ngữ theo quy mô: 7B, 13B, 30B cho đến 66B và hơn thế. Các mô hình 66B xuất hiện khi các nhóm nghiên cứu và công ty tìm kiếm cân bằng giữa chất lượng và chi phí huấn luyện.
66B thường dựa trên kiến trúc Transformer với hàng tỷ tham số, nhiều lớp tự attention, và cơ chế dense feed-forward. Tuy nhiên, kích thước tham số lớn đi kèm với chi phí lưu trữ và tối ưu hoá.
Đào tạo 66B đòi hỏi nguồn dữ liệu đa dạng, chất lượng cao và compute intensive. Các chiến lược như tiền huấn luyện trên nhiều nguồn dữ liệu, điều chỉnh finetuning cho tác vụ cụ thể giúp tăng hiệu suất.
66B có thể hỗ trợ sinh văn bản, trả lời câu hỏi, tóm tắt và phân tích ngôn ngữ tự nhiên ở nhiều ngữ cảnh. Tuy vậy, nó đối mặt với thách thức về chi phí, an toàn, định kiến và kiểm soát đầu ra.