ByteDance đang huấn luyện một mô hình AI với quy mô lên tới 10 nghìn tỷ tham số, theo Financial Times. Kích thước này đưa mô hình tiến gần hệ thống tiên tiến nhất của Anthropic. Bất kỳ ai theo dõi cuộc đua AI toàn cầu đều nên chú ý, vì đây là dấu hiệu cho thấy các phòng lab Trung Quốc đang thu hẹp khoảng cách với các hãng dẫn đầu của Mỹ nhanh đến mức nào.
Điều gì đã xảy ra
Mô hình này lớn gấp ba lần Kimi K3 của Moonshot, mô hình Trung Quốc lớn nhất từng được phát hành, theo ba nguồn tin nắm rõ vấn đề, dẫn lại từ Ars Technica. Giai đoạn pre-training thường kéo dài từ ba đến sáu tháng, và kích thước cuối cùng sẽ được xác định sau. Anthropic không công bố số lượng tham số, nhưng các ước tính trong ngành cho rằng Mythos 5 có khoảng 8 nghìn tỷ tham số và Fable 5 khoảng 5 nghìn tỷ. Mythos 5 đã bị giới hạn chỉ cho các tổ chức được phê duyệt sử dụng từ sau lệnh cấm an ninh vào tháng 6. Ứng dụng tiêu dùng Doubao của ByteDance có 324 triệu người dùng hoạt động hàng tháng, cao nhất tại Trung Quốc. Nhóm nghiên cứu Seed của công ty, do nhà khoa học cũ của Google DeepMind là Wu Yonghui dẫn đầu, có khoảng 2.000 thành viên. Nhà sáng lập Zhang Yiming đã nói với nhóm Seed, trong một cuộc họp nội bộ hai tuần trước, rằng hãy hướng tới "năng lực mô hình dẫn đầu thế giới" mà không cần lo lắng về những trở ngại ngắn hạn.
Bối cảnh
Các phòng lab Trung Quốc đã nhanh chóng bắt kịp trong năm nay. Các mô hình từ Moonshot và Alibaba đã đạt điểm benchmark chỉ đứng sau Fable 5 của Anthropic ở một số lĩnh vực. ByteDance giữ hình ảnh công khai thấp hơn so với các đối thủ, giữ hầu hết mô hình của mình ở dạng đóng trong khi đổ nguồn lực vào đơn vị cloud Volcano Engine và các kế hoạch chip AI tuỳ chỉnh. Khác với một số đối thủ, nhóm Seed của ByteDance đã tránh việc chưng cất kiến thức (distilling) từ mô hình của các lab khác trong hơn một năm qua, một con đường chậm hơn nhưng độc lập hơn. Cách tiếp cận này đã gây ra tranh luận nội bộ về việc liệu nó có khiến ByteDance mất thời gian trong cuộc đua bắt kịp các phòng lab tiên phong phương Tây hay không.
Vì sao điều này quan trọng với bạn
Với các nhà phát triển, một mô hình ByteDance lớn hơn có thể đồng nghĩa với cạnh tranh gay gắt hơn giữa các nền tảng AI Trung Quốc và Mỹ. Với người dùng, các mô hình Trung Quốc mạnh hơn có thể làm giảm chi phí tiếp cận AI tiên tiến, đặc biệt nếu được phát hành mở. Với các nhà cung cấp hạ tầng AI và các hãng chip, việc ByteDance thúc đẩy quy mô này thêm một người mua nữa tham gia cuộc đua giành compute và chip tuỳ chỉnh. Vấn đề tiếp cận cũng đáng lưu ý, Mythos 5 vẫn bị giới hạn cho các tổ chức được phê duyệt, nên phần lớn công nghệ tiên phong vẫn bị đóng kín. Nếu mô hình của ByteDance hoạt động tốt, hãy chờ đợi các chu kỳ lặp nhanh hơn trên toàn ngành và áp lực lớn hơn buộc Anthropic cùng các đối thủ phải chạy đua về quy mô huấn luyện, không chỉ về hiệu quả.
Câu hỏi lớn hơn
Nếu mô hình của ByteDance đạt quy mô tương đương Anthropic, liệu số lượng tham số thô có còn quyết định hệ thống AI nào dẫn đầu thế giới, hay chất lượng dữ liệu và phương pháp huấn luyện đã trở thành yếu tố quan trọng hơn? Báo cáo chỉ ra cả hai yếu tố đều quan trọng, nhưng các công ty vẫn tiếp tục đua nhau về quy mô. Khi ngày càng nhiều phòng lab tiến gần mốc 10 nghìn tỷ tham số, ngành công nghiệp có thể cần một câu trả lời rõ ràng hơn về điều gì thực sự phân biệt một mô hình dẫn đầu với một mô hình chỉ đơn thuần lớn.
Những điều cần theo dõi
Giai đoạn pre-training của ByteDance thường kéo dài ba đến sáu tháng, nghĩa là hình thái fine-tuned cuối cùng và việc phát hành, nếu xảy ra, có thể diễn ra vào cuối năm 2026 hoặc đầu năm 2027. Hãy theo dõi xác nhận về số lượng tham số cuối cùng, so sánh benchmark với Mythos 5 và Fable 5 của Anthropic, và liệu ByteDance sẽ mở hay tiếp tục giữ mô hình ở dạng đóng. Bonuz sẽ theo dõi cách điều này ảnh hưởng đến phần cứng và chip cho các thiết bị AI thế hệ tiếp theo, bao gồm cả thiết bị đeo (wearables).



