Alibaba ngày 26/8 công bố Qwen3.8-Flash, mô hình AI đa phương thức hướng đến các tác vụ lập trình, xử lý công việc văn phòng và sử dụng công cụ. Hãng cho biết kiến trúc mới giúp phiên bản trọng số mở Qwen3.8-Flash-Next chỉ cần khoảng một phần chín chi phí huấn luyện so với Qwen3.7-Plus, song các số liệu hiệu năng hiện chủ yếu dựa trên thử nghiệm do chính nhóm Qwen công bố.
Qwen, bộ phận phát triển trí tuệ nhân tạo của Alibaba, ngày 26/8 giới thiệu thế hệ mô hình mới gồm phiên bản thương mại Qwen3.8-Flash và mô hình trọng số mở Qwen3.8-Flash-Next.
Reuters mô tả Qwen3.8-Flash là mô hình đa phương thức mới, được Alibaba định vị cho các tác vụ lập trình và công việc văn phòng với chi phí thấp hơn. Trong khi đó, tài liệu kỹ thuật của Qwen cho biết Flash-Next còn đóng vai trò thử nghiệm sớm một số thay đổi kiến trúc mà hãng dự kiến tiếp tục phát triển trên dòng Qwen4.
Qwen3.8-Flash-Next sử dụng kiến trúc mixture-of-experts (MoE), với mô hình chính có khoảng 125 tỷ tham số và thêm 51 tỷ tham số N-gram embedding. Theo Alibaba, mỗi token chỉ kích hoạt khoảng 6 tỷ tham số của mô hình chính.
Đây là điểm quan trọng khi đánh giá hiệu quả tính toán.
Số tham số tổng thể thể hiện quy mô năng lực mà mô hình có thể lưu trữ, nhưng với MoE, không phải toàn bộ số tham số đều được sử dụng cho mỗi token. Việc chỉ kích hoạt một phần nhỏ giúp giảm lượng tính toán cần thiết trong quá trình suy luận so với một mô hình dense có quy mô tương đương.
Alibaba còn bổ sung N-gram embedding – một dạng bộ nhớ tra cứu dựa trên ngữ cảnh cục bộ. Hãng cho biết phần tham số này có thể được đặt trên bộ nhớ máy chủ thay vì phải thường xuyên chiếm bộ nhớ GPU, qua đó giảm thêm yêu cầu tài nguyên.
Tuy nhiên, số tham số thấp được kích hoạt không tự động đồng nghĩa mô hình luôn chạy nhanh hoặc rẻ hơn trong mọi ứng dụng. Tốc độ thực tế còn phụ thuộc phần cứng, độ dài đầu vào, cách triển khai, số người dùng đồng thời và hạ tầng phục vụ mô hình.
Alibaba nói chi phí huấn luyện chỉ bằng khoảng 1/9 Qwen3.7-Plus
Một trong những tuyên bố đáng chú ý nhất là chi phí huấn luyện.
Alibaba cho biết Qwen3.8-Flash-Next cần khoảng một phần chín chi phí huấn luyện của Qwen3.7-Plus, trong khi theo kết quả nội bộ, mô hình mới vẫn đạt hiệu năng tốt hơn ở một số nhóm tác vụ như coding và công việc văn phòng.
Cần hiểu đúng phạm vi của con số này.
Alibaba đang so sánh Qwen3.8-Flash-Next với Qwen3.7-Plus, chứ không nói toàn bộ quá trình phát triển Qwen3.8-Flash chỉ tốn một phần chín chi phí so với mọi mô hình AI trước đây.
Hãng cũng chưa công bố trong bản tin Reuters tổng số tiền cụ thể đã chi để huấn luyện hai mô hình. Vì vậy, từ tỷ lệ 1/9 không thể tính được chi phí huấn luyện tuyệt đối.
Ngoài ra, chi phí huấn luyện và chi phí sử dụng mô hình là hai khái niệm khác nhau. Huấn luyện là nguồn lực cần để xây dựng mô hình, còn giá API là số tiền khách hàng trả khi đưa dữ liệu vào và nhận kết quả từ mô hình đã được triển khai.
Phiên bản Qwen3.8-Flash-Next hỗ trợ 262.144 token ngữ cảnh nguyên bản và có thể mở rộng lên khoảng 1 triệu token bằng kỹ thuật YaRN. Phiên bản Qwen3.8-Flash cung cấp qua dịch vụ đám mây được Alibaba thiết kế với cửa sổ ngữ cảnh mặc định một triệu token.
Cửa sổ ngữ cảnh lớn giúp mô hình có thể tiếp nhận lượng dữ liệu dài hơn trong một phiên, chẳng hạn kho mã nguồn, tài liệu doanh nghiệp, chuỗi trao đổi dài hoặc tài liệu nghiên cứu.
Tuy nhiên, cửa sổ một triệu token là giới hạn kỹ thuật về lượng ngữ cảnh có thể xử lý, không đồng nghĩa mô hình sẽ ghi nhớ hoặc suy luận chính xác tuyệt đối trên toàn bộ lượng thông tin đó.
Khả năng tìm đúng chi tiết trong ngữ cảnh dài vẫn cần được đánh giá bằng các bài kiểm thử riêng.
Benchmark cho thấy cải thiện ở coding và công việc văn phòng
Trong kết quả Qwen tự công bố, Qwen3.8-Flash-Next đạt 62,5 điểm trên SWE-bench Pro, so với 55,8 của Qwen3.7-Plus.
Trên SWE-bench Multilingual, dùng để đánh giá năng lực xử lý các bài toán kỹ thuật phần mềm đa ngôn ngữ, mô hình mới đạt 81 điểm, cao hơn mức 75,8 của Qwen3.7-Plus.
Ở CoWorkBench, bài đánh giá các tác vụ văn phòng kéo dài nhiều bước, Qwen công bố Flash-Next đạt 73,9 điểm, so với 65,1 của Qwen3.7-Plus.
Với JobBench, bộ đánh giá các nhiệm vụ nghề nghiệp, kết quả tương ứng là 55,7 điểm, trong khi Qwen3.7-Plus đạt 27,6.
| Bài đánh giá | Qwen3.8-Flash-Next | Qwen3.7-Plus |
| SWE-bench Pro | 62,5 | 55,8 |
| SWE-bench Multilingual | 81,0 | 75,8 |
| CoWorkBench | 73,9 | 65,1 |
| JobBench | 55,7 | 27,6 |
Các số liệu trên cho thấy hướng tối ưu Alibaba đang theo đuổi, nhưng không nên coi đây là bằng chứng độc lập rằng Qwen3.8-Flash vượt các đối thủ trong sử dụng thực tế.
Bảng benchmark được nhóm Qwen lựa chọn, chạy và công bố trong tài liệu phát hành của chính họ. Kết quả có thể thay đổi theo cấu hình đánh giá, prompt, hệ thống công cụ và phương pháp chấm điểm.
Do mô hình mới được phát hành ngày 26/8, cần thêm các thử nghiệm bên ngoài và đánh giá trong môi trường thực tế trước khi có thể so sánh toàn diện hiệu năng, độ ổn định và chi phí với những mô hình cạnh tranh.
Giá API hướng tới nhóm ứng dụng quy mô lớn
Reuters cho biết Alibaba công bố giá truy cập Qwen3.8-Flash tại Trung Quốc ở mức 1 nhân dân tệ cho một triệu token đầu vào và 3 nhân dân tệ cho một triệu token đầu ra, tương đương khoảng 0,15 USD và 0,45 USD tại tỷ giá Reuters sử dụng trong ngày 26/8.
Trong tài liệu quốc tế của QwenCloud, hãng niêm yết mức khoảng 0,16 USD cho một triệu token đầu vào và 0,47 USD cho một triệu token đầu ra.
Sự khác biệt nhỏ giữa hai mức giá có thể liên quan thị trường và cách quy đổi tiền tệ. Vì thế, khi đưa tin không nên coi chúng là hai bảng giá mâu thuẫn mà cần gắn giá với khu vực dịch vụ tương ứng.
Nếu mức giá này được duy trì khi API vận hành rộng rãi, Qwen3.8-Flash được định vị rõ vào nhóm mô hình ưu tiên chi phí thấp cho lượng tác vụ lớn, như trợ lý lập trình, agent doanh nghiệp hoặc quy trình tự động hóa.
Tuy nhiên, giá trên mỗi token chưa phản ánh toàn bộ chi phí của một hệ thống AI. Doanh nghiệp còn có thể phát sinh chi phí lưu trữ dữ liệu, hạ tầng, tìm kiếm, gọi công cụ, bảo mật và vận hành ứng dụng.
Phiên bản mở và phiên bản dịch vụ cần được phân biệt
Alibaba đang sử dụng hai tên gần nhau nhưng không hoàn toàn giống nhau.
Qwen3.8-Flash-Next là phiên bản mà Qwen đã phát hành trọng số trên Hugging Face và ModelScope để cộng đồng tải xuống, nghiên cứu và đánh giá kiến trúc.
Trong khi đó, Qwen3.8-Flash là tên phiên bản sản xuất được cung cấp trên QwenCloud. Theo Qwen, phiên bản thương mại có ngữ cảnh mặc định một triệu token và tích hợp các công cụ chính thức.
Reuters dùng tên Qwen3.8-Flash cho sản phẩm mới trong tiêu đề, đồng thời xác nhận Alibaba cũng phát hành trọng số mở của Qwen3.8-Flash-Next.
Vì vậy, viết “Alibaba mở mã nguồn Qwen3.8-Flash” sẽ chưa thật chính xác. Cách chặt chẽ hơn là Alibaba cung cấp Qwen3.8-Flash qua dịch vụ đám mây và phát hành trọng số mở của Qwen3.8-Flash-Next.
Qwen3.8-Flash xuất hiện chưa đầy một tháng sau khi Alibaba trình làng Qwen3.8-Max, mô hình chủ lực có 2,4 nghìn tỷ tham số và cửa sổ ngữ cảnh tối đa một triệu token.
Hai sản phẩm thể hiện hai hướng khác nhau trong chiến lược của Alibaba: Qwen3.8-Max ưu tiên quy mô và năng lực cao, còn Qwen3.8-Flash tập trung mạnh hơn vào cân bằng giữa hiệu năng và chi phí.
Chi phí đặc biệt quan trọng trong bối cảnh các hãng AI Trung Quốc phải mở rộng năng lực tính toán trong khi việc tiếp cận một số chip AI cao cấp của Mỹ còn bị hạn chế. Reuters cho biết cạnh tranh tại Trung Quốc đang thúc đẩy các công ty phát triển kiến trúc tiết kiệm tài nguyên hơn.
Alibaba cũng vừa huy động khoảng 80 tỷ HKD, tương đương hơn 10 tỷ USD, qua phát hành cổ phiếu mới và cho biết toàn bộ số tiền ròng sẽ được đầu tư vào năng lực AI toàn diện, gồm chip, hạ tầng và phát triển mô hình.
Điều này cho thấy việc giảm chi phí trên từng mô hình không đồng nghĩa Alibaba giảm tổng chi cho AI. Ngược lại, tập đoàn đang tăng đầu tư lớn vào hạ tầng, trong khi tìm cách giảm chi phí tính toán trên mỗi đơn vị công việc.








































































