阿里巴巴旗下千问(Qwen)团队于8月3日正式宣布千问3.8-Max,,,总参数目2.4万亿,,,激活参数95B,,,是千问家族迄今规模最大、能力最强的模子。。。。这也是千问首次将Max级别模子开源——权重将于下周在开源社区Hugging Face和ModelScope宣布。。。。
定价方面,,,千问3.8-Max通过千问AI平台(阿里云)提供API挪用:输入2.0美元/百万tokens,,,输出6.0美元/百万tokens,,,隐式缓存0.25美元/百万tokens。。。。
基准测试显示,,,千问3.8-Max在编程智能体和通用智能体多项指标上与Anthropic Fable5体现相当,,,部分指标逾越后者。。。。例如,,,PaperBench得分93.0,,,高于Fable5的88.8;;;CoWorkBench得分74.8,,,与Fable5的75.9靠近;;;WideSearch得分81.9,,,与Fable5的81.2持平。。。。
性能:与 Fable 5 相当,,,部分逾越
凭证千问团队宣布的完整基准测试数据,,,Qwen3.8-Max 在多个焦点指标上与 Anthropic Claude Fable 5 持平或凌驾:
PaperBench(论文能力):Qwen3.8-Max 得分93.0,,,凌驾 Fable 5 的 88.8 和 GPT-5.6 Sol 的 90.5IFBench:Qwen3.8-Max82.8,,,Fable 5 为 63.5,,,GPT-5.6 Sol 为 72.7HealthBench:Qwen3.8-Max60.2,,,凌驾 GPT-5.6 Sol 的 55.3CoWorkBench(通用协作):Qwen3.8-Max74.8,,,Fable 5 为 75.9,,,差别极小JobBench(AI事情能力):Qwen3.8-Max53.4,,,靠近 Fable 5 的 57.4
多模态方面同样体现突出:
OSWorld-Verified:Qwen3.8-Max86.1,,,凌驾 Fable 5 的 85.0AndroidWorld85.3,,,Fable 5 为 88.8MLVU(长视频)90.8,,,Fable 5 无数据
值得注重的是,,,Fable 5 的部分效果可能包括回退机制,,,千问团队在注释中对此作了说明。。。。
编程能力:从空文件夹到生产级交付
千问团队用三个真实案例测试了千问3.8-Max的自主编程能力,,,全程无人工介入。。。。
案例一:十天级自动编程。。。。模子从零建设oh-my-cli项目,,,自主运行约16天,,,累计完成265次commits、127个PR、151个issues。。。。它将用户反馈、社区实践与自测效果统一纳入工程循环,,,实现需求自动领取、代码天生、测试验证的完整闭环。。。。
案例二:复现并逾越论文。。。。模子自力事情约125小时,,,写下约7,600行代码,,,执行凌驾1,100步操作,,,跑了33轮GPU训练,,,完整复现了论文《Unified Data Selection for LLM Reasoning》的六项主要结论。。。。随后进入"自我进化"阶段,,,提出并测试18种刷新方案,,,最终在竞赛级数学基准AIME24上比论文原要领再提升2.7分。。。。
案例三:24小时击败87%人类步队。。。。模子加入WWW2025多模态对话意图识别挑战赛,,,在526支人类步队中,,,经45次提交迭代,,,准确率从0.60升至0.853,,,击败458支步队。。。。
办公与长程使命:数百职业场景的生产级验证
千问团队在数百种高价值职业场景中测试了千问3.8-Max的现实交付能力。。。。
企业合纪状师:单次通读数百份文档,,,标出1,284条相关条款,,,一小时内完成——一律事情通常需要法务团队约一周。。。。
UI/UX设计师:天生包括8个页面的高保真可交互原型,,,全程未经人工返修。。。。
结构工程师:仅凭一份图纸,,,在浏览器中还原30层写字楼的抗震结构模子,,,古板流程需一周以上。。。。
量化研究:从一句使命形貌出发,,,调理约330个子智能体,,,完成约6,000次回测,,,将原本需要数周的量化研究压缩为一次对话内完成。。。。
在E-Commerce Bench(365天电商谋划模拟基准)中,,,千问3.8-Max以?416,252(4.16倍回报)胜出,,,凌驾第二名GLM 5.2达38%,,,较上一代千问3.7-Max提升152%。。。。
芯片设计:500轮交互,,,面积缩减81%
千问3.8-Max在芯片设计优化使命中展示了长程自主妄想能力。。。。
目的是优化一个G CD/RSA密码硬件加速器的逻辑门数目。。。。模子在无参考设计、无人工干预的条件下,,,历经约500轮交互、71次评估,,,跨越13个要害里程碑,,,将初始设计从8,298门优化至678门,,,在所有参评模子中体现最优。。。。
物理实现层面,,,芯片面积从106×106 ?m?缩短至46×46 ?m?,,,布线长度从33,369 ?m降至4,187 ?m,,,并实现500 MHz频率下的时序闭合,,,芯片面积整体缩减81%。。。。
多模态能力:视觉贯串执行全流程
千问3.8-Max的视觉能力不止于"看懂图片",,,而是作为一连反馈回路贯串使命执行。。。。
模子在执行历程中会一连视察中心产品——检查页面结构、物体偏向、动画效果——发明问题后自主定位误差并修正。。。。千问团队将这一能力界说为"原生视觉反馈回路"。。。。
基准测试方面,,,千问3.8-Max在OSWorld-Verified得分86.1,,,凌驾Fable5的85.0;;;AndroidWorld得分85.3,,,靠近Fable5的88.8;;;ParametricCAD Bench得分91.5,,,凌驾Fable5的87.5。。。。
为便于开发者接入,,,千问团队同步推出千问-MM-Plugins,,,为差别智能体框架提供图像与视频处理、多模态影象、视觉工具挪用等扩展支持。。。。
开放接入:支持Claude Code、Codex等主流框架
千问3.8-Max现已通过千问AI平台提供API服务,,,支持OpenAI兼容协媾和Anthropic兼容协议,,,可直接与Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw等主流开发工具集成。。。。
API支持reasoning_effort参数调理推理深度:xhigh(默认,,,适合重大使命)、medium(平衡准确性与速率)、low(优化速率与本钱)。。。。
模子权重将于下周在Hugging Face和ModelScope开源,,,届时千问3.8-27B也将同步开源。。。。