Có gì mới
Qwen3.8-Max là model mạnh nhất trong dòng Qwen tính đến bài công bố. Alibaba mô tả model có 2.4T parameters, trong đó 95B active, xây trên nền Qwen 3.5 và tập trung vào coding, work, research, multimodal và tác vụ dài hơi. Model đã có trên QwenCloud; weights của lớp Max-scale được hứa mở trên Hugging Face và ModelScope vào tuần sau.
Với dev, phần thực dụng nhất là API. QwenCloud hỗ trợ chat completions và responses API tương thích OpenAI, đồng thời có interface tương thích Anthropic. Bài viết đưa ví dụ cấu hình cho Claude Code, Codex-style setup và Continue, dùng model id qwen3.8-max.
Năng lực được công bố
Alibaba nhấn mạnh ba case coding/autonomous work. Case thứ nhất là một run tự động nhiều ngày tạo repo oh-my-cli, sau khoảng 16 ngày có 265 commits, 127 PRs và 151 issues. Case thứ hai yêu cầu model tái lập paper Unified Data Selection for LLM Reasoning, viết khoảng 7,600 dòng code, chạy 33 vòng GPU training và cải thiện AIME24 thêm 2.7 điểm so với phương pháp của paper. Case thứ ba là cuộc thi multimodal dialogue intent recognition với 526 đội người; model đạt 0.853 accuracy sau 45 submissions và vượt 458 đội.
Bài viết cũng đưa nhiều benchmark về software engineering, terminal task, workflow, document, video và business simulation. Đây là số liệu do vendor công bố, nên nên đọc như tín hiệu định hướng và điểm bắt đầu để thử nghiệm, không phải kết luận độc lập.
Cách dùng
API có tham số reasoning_effort với các mức xhigh, medium và low để đổi độ sâu suy luận lấy tốc độ và chi phí. Ví dụ OpenAI-compatible dùng DASHSCOPE_API_KEY và base URL compatible-mode của DashScope. Với Codex-style cấu hình, model catalog có thể khai báo qwen3.8-max, context_window 1000000 và supported_reasoning_levels gồm low, medium, xhigh.
Dev nên quan tâm vì…
Nếu weights thật sự được mở đúng hẹn, đây là một mốc đáng theo dõi cho nhóm cần model mạnh nhưng muốn tự chủ deployment hoặc ít nhất có lựa chọn ngoài API đóng. Còn nếu chỉ dùng API, giá trị trước mắt nằm ở tương thích giao thức và khả năng cắm vào agent framework sẵn có. Phần cần kiểm chứng là economics, latency, rate limit, chất lượng trên codebase thật và mức độ bền của long-horizon workflow ngoài benchmark do nhà cung cấp chọn.