7 phút đọc
Ngày 27/8, startup Z.AI (còn được biết đến với tên gọi Zhipu AI tại Trung Quốc) đã chính thức ra mắt GLM-5.3-Flash, mô hình nguồn mở được xác nhận chính là “AI bí ẩn” Ox Alpha từng gây sốt trên các nền tảng thử nghiệm toàn cầu. Đáng chú ý, startup này tuyên bố mô hình mới được vận hành hoàn toàn trên hạ tầng chip do Trung Quốc tự sản xuất.

Lời giải cho bài toán tự lực phần cứng của Trung Quốc
Trước khi chính thức ra mắt, Ox Alpha đã được thử nghiệm dưới dạng một mô hình bí mật từ một bên thứ ba ẩn danh trên hai nền tảng OpenRouter và OpenCode nhằm thu thập phản hồi của người dùng. Sự xuất hiện của mô hình này đã nhanh chóng thu hút sự chú ý của cộng đồng công nghệ toàn cầu nhờ hiệu năng ấn tượng.
Tại buổi lễ công bố, Z.AI cho biết mô hình GLM-5.3-Flash hoạt động hoàn toàn trên một cụm máy chủ chứa 100.000 chip AI nội địa. Dù công ty không chỉ đích danh nhà cung cấp phần cứng cụ thể, các nguồn tin từ China Daily cho biết startup này hiện đang hợp tác chặt chẽ với nhiều nhà sản xuất bán dẫn lớn trong nước như Huawei, Cambricon Technologies và Moore Threads. Ngay trong ngày ra mắt, cả Cambricon và Moore Threads đều lên tiếng xác nhận đã hỗ trợ tương thích cho mô hình AI mới này ngay từ những ngày đầu tiên.
Theo đánh giá từ tờ South China Morning Post (SCMP), việc vận hành một mô hình quy mô lớn hoàn toàn bằng chip nội địa đánh dấu một thử nghiệm quan trọng đối với năng lực của Trung Quốc trong việc xử lý các tác vụ suy luận tải trọng cao trên phần cứng tự sản xuất, trong bối cảnh nước này đang nỗ lực giảm bớt sự phụ thuộc vào các bộ xử lý tiên tiến từ tập đoàn Nvidia của Mỹ.
Để khắc phục các điểm yếu cố hữu của chip AI Trung Quốc như dung lượng bộ nhớ và băng thông thấp, Z.AI đã áp dụng một kiến trúc điều chỉnh đặc biệt. Mô hình GLM-5.3-Flash sở hữu tổng cộng 320 tỷ tham số, nhưng hệ thống chỉ kích hoạt 18 tỷ tham số cho mỗi yêu cầu xử lý để giảm thiểu gánh nặng tính toán. Công ty cũng tự xây dựng một công cụ suy luận chuyên dụng để chia giai đoạn xử lý thành các nhóm tính toán quản lý độc lập. Z.AI tuyên bố giải pháp này giúp tăng hiệu năng phục vụ lên gấp ba lần, đưa hiệu quả hoạt động của phần cứng và chi phí trên mỗi token ngang hàng với các bộ tăng tốc chính thống của Nvidia. Tuy nhiên, các biên tập viên công nghệ lưu ý rằng những tuyên bố về mặt hiệu năng này hiện vẫn chưa được xác minh một cách độc lập.
Hiệu năng thực tế và chiến lược giá rẻ cạnh tranh
Bên cạnh yếu tố phần cứng tự chủ, GLM-5.3-Flash còn gây ấn tượng bởi các chỉ số vận hành thực tế. Đây là mô hình đầu tiên trong dòng GLM-5 có khả năng xử lý đồng thời cả thông tin hình ảnh và văn bản một cách tự nhiên. Trước khi ra mắt chính thức, mô hình đã xử lý tới 62.000 tỷ token trên các nền tảng OpenRouter và OpenCode.
Số liệu độc lập từ OpenRouter cho thấy hệ thống đã xử lý hơn 11.000 tỷ token chỉ trong ba ngày đầu tiên thử nghiệm, chiếm gần 31% tổng khối lượng giao dịch hàng tuần của nền tảng này. Đơn vị đánh giá độc lập Artificial Analysis đã chấm mô hình đạt 57 điểm, xếp thứ 10 toàn cầu và đứng thứ 3 trong số các mô hình trọng số mở (open-weight) trên thế giới, chỉ xếp sau hai đại diện khác cũng đến từ Trung Quốc là Kimi K3 của Moonshot AI và Qwen3.8 2.4T A95B của tập đoàn Alibaba.
Nhằm thu hút các nhà phát triển trong và ngoài nước, Z.AI đang áp dụng chính sách giá cực kỳ cạnh tranh:
- Chi phí cơ bản: 0,15 USD cho mỗi 1 triệu token đầu vào (input) và 0,5 USD cho mỗi 1 triệu token đầu ra (output) – mức giá này chỉ bằng 1/10 so với mô hình tiêu chuẩn GLM-5.3.
- Chương trình khuyến mãi: Chi phí thậm chí có thể giảm xuống chỉ còn 1/20 so với bản tiêu chuẩn.
- So sánh với đối thủ Mỹ: Mức giá này chỉ bằng khoảng 1/40 so với mô hình Opus 4.8 của Anthropic, dù Z.AI khẳng định hai mô hình có mức độ thông minh tương đương.
Trang tin công nghệ TechCrunch nhận định, sự xuất hiện của Ox Alpha (GLM-5.3-Flash) với mức giá siêu rẻ và hiệu quả cao đang làm tăng khả năng các doanh nghiệp Trung Quốc chiếm lĩnh thị phần đáng kể từ tay các công ty phát triển mô hình tiên tiến nhưng đắt đỏ của Mỹ như OpenAI hay Anthropic. Sức hút của sản phẩm mới cũng ngay lập tức tác động tích cực đến tài chính của doanh nghiệp khi cổ phiếu của Z.AI đã tăng hơn 12% trên sàn chứng khoán Hong Kong sau phiên giao dịch ngày 27/8.
Phản hồi thực tế từ cộng đồng lập trình viên: Khen chê lẫn lộn
Mặc dù ghi nhận lượng truy cập khổng lồ trong giai đoạn dùng thử miễn phí, phản hồi thực tế từ giới lập trình viên đối với mô hình này hiện vẫn đang nhận về nhiều ý kiến trái chiều. Ở khía cạnh tích cực, CEO của hãng công nghệ Stripe, ông Patrick Collison, sau khi dùng thử mô hình đã đưa ra nhận xét là “rất ấn tượng”. Nhiều nhà phát triển cũng đánh giá cao khả năng gỡ lỗi (debug) mã phức tạp của mô hình khi nó giải quyết thành công 28% trong số 175 bài toán lập trình trên công cụ đánh giá năng lực LiveCodeBench.
Ở chiều ngược lại, không ít lập trình viên phản ánh rằng mô hình AI này vẫn gặp phải hiện tượng “ảo giác” (hallucination) – đưa ra các thông tin sai lệch hoặc không có thật. Bên cạnh đó, các tác vụ đôi khi bị bỏ dở giữa chừng và tốc độ tạo mã nguồn còn chậm chạp. Đơn vị Artificial Analysis cũng đưa ra đánh giá tương tự khi xác nhận tốc độ dữ liệu của GLM-5.3-Flash hiện đang “chậm hơn mức trung bình của ngành”.
Những điểm người dùng cần tiếp tục theo dõi
Được thành lập từ năm 2019 tại Bắc Kinh bởi một nhóm nghiên cứu xuất thân từ Đại học Thanh Hoa, Z.AI đã nhanh chóng vươn lên thành một trong những startup AI hàng đầu Trung Quốc nhờ sự hậu thuẫn từ các quỹ đầu tư và các tập đoàn công nghệ lớn trong nước. Việc ra mắt mô hình GLM-5.3-Flash chạy hoàn toàn trên chip nội địa đã chứng minh bước tiến lớn về mặt công nghệ của quốc gia này.
Tuy nhiên, người dùng và các nhà phát triển công nghệ cần tiếp tục theo dõi xem liệu tuyên bố về hiệu năng và chi phí phần cứng ngang hàng với chip Nvidia của Z.AI có vượt qua được các thử nghiệm độc lập khắt khe trong tương lai hay không. Đồng thời, khả năng khắc phục các lỗi vận hành thực tế như tốc độ xử lý chậm và hiện tượng ảo giác của mô hình cũng sẽ là những yếu tố quyết định liệu sản phẩm này có thể duy trì được sức hút lâu dài trước các đối thủ nặng ký từ Thung lũng Silicon.
Nguồn tham khảo: Xem bài gốc