Z.ai xác nhận đứng sau mô hình AI bí ẩn Ox Alpha

Hãng AI Trung Quốc Z.ai xác nhận Ox Alpha, mô hình xuất hiện ẩn danh trên OpenRouter và OpenCode từ ngày 20/8, thực chất là bản thử nghiệm trước khi phát hành của GLM-5.3-Flash. Mô hình có 320 tỷ tham số, kích hoạt khoảng 18 tỷ tham số mỗi lần xử lý và hỗ trợ ngữ cảnh tới một triệu token. Các tuyên bố so sánh hiệu năng hiện phần lớn do nhà phát triển công bố hoặc tổng hợp từ những benchmark do họ lựa chọn.

Z.ai ngày 26/8 công bố GLM-5.3-Flash và chính thức xác nhận hãng đã thử nghiệm mô hình này ẩn danh dưới tên “ox-alpha” trên OpenRouter và OpenCode trước khi phát hành.

Theo Z.ai, cách đưa mô hình ra thị trường mà chưa tiết lộ nhà phát triển nhằm thu thập phản hồi từ người dùng trong môi trường thực tế trước khi công bố sản phẩm chính thức. Ox Alpha xuất hiện từ ngày 20/8 và nhanh chóng thu hút sự chú ý của cộng đồng phát triển phần mềm do được cung cấp miễn phí trong giai đoạn thử nghiệm. Vì vậy, cách diễn đạt chính xác là “Ox Alpha là phiên bản thử nghiệm ẩn danh của GLM-5.3-Flash”, thay vì xem đây là hai mô hình độc lập.

320 tỷ tham số, chỉ kích hoạt khoảng 18 tỷ

GLM-5.3-Flash sử dụng kiến trúc Mixture-of-Experts với khoảng 320 tỷ tham số tổng cộng nhưng chỉ khoảng 18 tỷ được kích hoạt khi xử lý mỗi token. Z.ai cho biết đây là mô hình đa phương thức nguyên bản đầu tiên trong dòng GLM-5.

Mô hình được huấn luyện trên tập dữ liệu đa phương thức khoảng 30.000 tỷ token, theo công bố của nhà phát triển. Z.ai kết hợp cơ chế sparse attention và linear attention nhằm giảm lượng tính toán, đặc biệt khi xử lý đầu vào dài.

Việc chỉ kích hoạt một phần tham số là một trong những cách giảm chi phí suy luận của mô hình MoE. Tuy nhiên, con số 18 tỷ tham số hoạt động không tự động đồng nghĩa mô hình nhanh hơn một tỷ lệ tương ứng. Hiệu suất thực tế còn phụ thuộc phần cứng, cách triển khai, độ dài ngữ cảnh và tải của hệ thống.

Có thể xử lý văn bản và hình ảnh

Kho lưu trữ chính thức của Z.ai trên Hugging Face xác nhận GLM-5.3-Flash hỗ trợ đầu vào đa phương thức. Ví dụ triển khai do hãng cung cấp cho phép người dùng kết hợp hình ảnh và văn bản trong cùng yêu cầu. Model card cũng phân loại mô hình ở nhóm image-text-to-text. Z.ai quảng bá mô hình cho nhiều nhóm công việc như lập trình, agent tự động, phân tích tài liệu và các tác vụ chuyên môn có kết hợp thông tin trực quan.

Giới hạn ngữ cảnh có thể đạt một triệu token trong một số cấu hình. Tài liệu benchmark chính thức của Z.ai cho biết bài NL2Repo được chạy với ngữ cảnh 1 triệu token, trong khi một số bài kiểm thử khác sử dụng cửa sổ 164.000, 300.000 hoặc 400.000 token tùy bài toán. Do đó, “hỗ trợ một triệu token” nên được hiểu là năng lực ngữ cảnh tối đa của mô hình trong cấu hình phù hợp, không phải mọi tác vụ đều mặc định sử dụng một triệu token hay giữ độ chính xác như nhau trên toàn bộ chiều dài đó.

Benchmark cho thấy cải thiện mạnh về coding

Z.ai công bố GLM-5.3-Flash đạt 63,4 điểm trên DeepSWE, so với 46,2 của GLM-5.2. Với AutomationBench, kết quả được hãng đưa ra là 48,8 điểm, so với 26,2 của thế hệ trước. Model card trên Hugging Face hiện cũng hiển thị một số kết quả như:

Benchmark

GLM-5.3-Flash

Terminal-Bench 2.1

84,3

DeepSWE

63,4

HLE

55,3

Z.ai đồng thời nói GLM-5.3-Flash tiến gần Claude Opus 4.8 trên một số benchmark coding và agent, trong khi giá sử dụng thấp hơn đáng kể. Đây là so sánh do Z.ai công bố, không nên chuyển thành kết luận rằng mô hình vượt đối thủ trên mọi tác vụ. Cũng cần lưu ý không phải toàn bộ benchmark đều hoàn toàn “nội bộ”. Model card cho biết một số bài sử dụng dịch vụ đánh giá chính thức hoặc kết quả từ Artificial Analysis. Tuy nhiên, việc lựa chọn benchmark, cấu hình thử nghiệm và cách tổng hợp kết quả trong thông báo ra mắt vẫn do Z.ai thực hiện.

Z.ai cho biết GLM-5.3-Flash đạt hiệu năng tốt hơn GLM-5.2 trên nhiều bài thử trong khi chi phí sử dụng chỉ khoảng một phần mười. Đây tiếp tục là con số do doanh nghiệp công bố dựa trên cách định giá và khối lượng công việc mà hãng sử dụng để so sánh. Do đó, cần phân biệt giá API với chi phí vận hành thực tế.

Một doanh nghiệp tự triển khai bộ trọng số GLM-5.3-Flash vẫn phải chịu chi phí máy chủ, bộ nhớ, điện năng, hạ tầng mạng, nhân sự và tối ưu phần mềm. Việc một API có giá thấp hơn không có nghĩa tổng chi phí sở hữu của mọi hệ thống cũng giảm đúng 90%.

Một chi tiết được chú ý là Z.ai tuyên bố toàn bộ lưu lượng thử nghiệm Ox Alpha trong tuần trước khi ra mắt đã được phục vụ bằng chip AI sản xuất tại Trung Quốc. Hãng cho biết đã xây dựng hệ thống phục vụ quy mô lớn với kết nối băng thông cao và bộ máy suy luận được tối ưu riêng cho kiến trúc của GLM-5.3-Flash.

Tuy nhiên, Z.ai chưa công bố đầy đủ loại chip, cấu hình cụm máy hoặc dữ liệu vận hành để bên ngoài có thể kiểm chứng toàn diện tuyên bố này. Các bản tin quốc tế cũng lưu ý thông tin về việc toàn bộ lưu lượng chạy trên chip nội địa chưa được xác minh độc lập. Vì vậy, nên viết “Z.ai cho biết” thay vì khẳng định như một dữ kiện đã được kiểm toán.

Trọng số được phát hành theo giấy phép MIT

Z.ai đã đưa GLM-5.3-Flash lên Hugging Face. Kho mô hình chính thức ghi rõ License: MIT, đồng thời cung cấp trọng số để nhà phát triển triển khai bằng các framework như Transformers, SGLang, vLLM và KTransformers. Điểm này giúp phân biệt GLM-5.3-Flash với nhiều mô hình chỉ cung cấp quyền truy cập thông qua API. Tuy nhiên, thuật ngữ “open source AI” vẫn có nhiều cách định nghĩa trong ngành. Về mặt thông tin có thể xác nhận trực tiếp, cách chặt chẽ nhất là nói: “Z.ai phát hành trọng số GLM-5.3-Flash theo giấy phép MIT.”

Giấy phép MIT của kho mô hình cũng không phải một chứng nhận rằng mọi ứng dụng được xây dựng bằng mô hình sẽ tự động phù hợp với pháp luật về dữ liệu, bản quyền hoặc AI tại từng quốc gia. Đơn vị triển khai vẫn phải tự đánh giá nghĩa vụ pháp lý tương ứng với cách sử dụng của mình.

Z.ai là thương hiệu quốc tế của Zhipu AI, công ty được hình thành từ các thành quả nghiên cứu của Đại học Thanh Hoa và thành lập năm 2019. Công ty đã niêm yết trên Sở Giao dịch Chứng khoán Hong Kong ngày 8/1/2026, mã 02513.HK, huy động khoảng 4,3 tỷ HKD trong IPO. Vì thế, trong bản tin hiện tại, gọi Z.ai là “hãng AI Trung Quốc” hoặc “công ty AI Trung Quốc” chính xác hơn “startup Trung Quốc”. Việc GLM-5.3-Flash được phát hành cũng diễn ra trong bối cảnh các hãng AI Trung Quốc cạnh tranh ngày càng mạnh về ba yếu tố: hiệu năng mô hình, chi phí suy luận và khả năng vận hành trên hạ tầng chip trong nước.

 

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *

Ảnh 1

Tin tức mới nhất