
过去两年,我们判断一个大模型够不够强配资概念股票,往往会问:它能不能回答复杂问题,数学推理怎么样,代码写得准不准。
但当模型能力逐渐逼近,新的问题已经变成:如果人不再守在旁边,它能不能把一件事继续做下去?
不是生成几段代码,也不是给出一份看起来完整的方案,而是自己拆解任务、调用工具、检查结果,在遇到错误后重新调整,最后交付一个真正可用的成果。

这正是阿里新一代旗舰模型Qwen3.8-Max想要回答的问题。
8月3日,Qwen团队正式发布Qwen3.8-Max。它拥有2.4万亿总参数,是目前规模最大的千问模型;但相比这个惊人的数字,更值得关注的是它将升级重点放在了自主编程、专业工作、科学研究、原生多模态和长周期任务上。
换句话说,Qwen3.8-Max不只想成为一个更聪明的聊天机器人,而是试图成为一个能够连续工作的AI同事。
2.4万亿背后
Qwen3.8-Max采用混合专家架构,也就是MoE。虽然模型总参数达到2.4万亿,但每次处理任务时,只会激活其中约950亿参数,相当于总规模的4%左右。
这并不意味着剩下的参数没有作用,而是模型会根据当前内容选择不同的专家模块参与计算。相比每次都调用全部参数,这种设计能够在扩大模型容量的同时,尽可能控制推理成本和响应速度。
所以,2.4万亿代表的是Qwen3.8-Max能够容纳的知识与能力规模,950亿激活参数则更接近一次实际推理需要动用的计算量。参数规模也不能直接等同于模型能力,真正决定体验的依然是训练质量、模型架构和任务完成效率。
不过,即便采用MoE,Qwen3.8-Max也不是普通用户能够轻松部署在个人电脑上的模型。仅按4bit精度粗略计算,完整权重就需要约1.2TB存储空间,还没有算运行时产生的额外开销。未来开放权重后,它主要仍将面向云服务商、研究机构和拥有大型计算集群的企业。
更适合个人和中小团队部署的,可能是官方同时预告的Qwen3.8-27B。
一次读完更多
Qwen3.8-Max是一款原生多模态模型,可以同时接收文字、图片和视频,输出文字结果。它拥有100万Token上下文窗口,QwenCloud公布的实际规格为最高约99.1万Token输入;开启思考模式后约为98.3万Token,单次最多可以输出约13.1万Token。
这意味着它能够一次读取大型代码仓库、数百页的行业报告、成批的法律文件,甚至较长的视频内容,而不必频繁地切割、摘要和重新拼接上下文。
当然,上下文更长并不代表模型会自动记住其中的每一个细节。真正重要的是,它能否在长上下文中找到与当前任务有关的信息,并在多轮操作后维持目标、状态和约束的一致性。
这也是Qwen3.8-Max最核心的一次升级:它不仅能够读得更多,还试图工作得更久。
从复现到发现
Qwen3.8-Max还被要求从零复现一篇机器学习论文。官方称,在没有现成代码和实验流程的情况下,模型连续工作约125小时,编写约7600行代码,完成1100多次操作和33轮GPU训练。

它先复现了论文中的6项主要结论,随后又花费约88小时测试18种新思路,最终提出的方法在AIME24数学评测上比原论文方案提高了2.7个百分点。
另一次芯片设计实验则持续约500轮交互和71次评估。模型将一套加密电路从最初的8298个逻辑门,逐步压缩至678个逻辑门,并在每一轮中根据仿真、综合与时序结果调整设计。
这些案例共同指向了一种能力:模型不再只是根据已有信息给出答案,而是能够提出假设、执行实验、获得反馈,再利用新结果修改下一步行动。

这也是“长周期任务”真正困难的地方。一次回答错了,可以重新提问;但一个运行几百轮的智能体,只要早期出现一个没有被发现的错误,后续所有努力都可能建立在错误基础上。模型必须学会检查、回退和重新规划,而不只是一直向前生成内容。
不只会写代码
“Coding and Cowork”是Qwen团队为Qwen3.8-Max设定的核心方向。这里的Cowork并不是简单地写文档、做总结,而是让模型进入法律、金融、医疗、设计和数据分析等专业流程,最终交付能够继续使用的文件或成果。

在这个过程中,Qwen3.8-Max的视觉能力也不再只是识别一张图片。
例如,在制作网页、PPT或三维场景时,模型可以先生成内容,再查看实际渲染结果,识别文字溢出、排版错位或视觉效果不符合要求的问题,随后返回代码和工具进行修改。视觉由一次性的输入,变成了贯穿规划、执行和检查过程的反馈通道。
这可能比单纯提高图片问答分数更加重要。因为人类使用电脑时,本来就是一边操作、一边观察结果,再决定下一步做什么。只有视觉真正进入行动循环,多模态模型才有机会从“看懂图片”走向“使用电脑完成工作”。
跑分并非全面领先
从Qwen团队公布的测试结果来看,Qwen3.8-Max已经进入当前第一梯队,但它并没有在所有项目上取得第一。

在考察终端环境操作能力的Terminal-Bench 2.1中,Qwen3.8-Max得到86.6分,高于Claude Opus 4.8和Claude Fable 5的84.6分,但仍略低于GPT-5.6 Sol的88.8分。
在考察论文复现能力的PaperBench中,它得到93.0分,是官方比较模型中的最高成绩;GPQA Diamond为92.6分,也处于第一梯队。
但在更加贴近大型代码仓库维护的SWE-bench Pro上,Qwen3.8-Max得到67.7分,低于Claude Fable 5的80.0分;FrontierSWE成绩为73.5分,同样落后于后者的88.8分。
这些成绩说明,Qwen3.8-Max在终端操作、研究复现、工具使用和长周期任务上表现突出,但并不能简单概括为“全面超过所有模型”。不同测试使用的智能体框架、工具权限、上下文长度和尝试次数也可能影响最终成绩。

模型发布后,Qwen3.8-Max成为当时排名最高的中国文本模型,并在视觉模型榜单中位列全球第二,仅落后一款Claude Fable 5版本。不过公开榜单变化很快,这更适合作为模型进入全球第一梯队的证明,而不是永久不变的排名。
价格与开放
在海外QwenCloud平台上,Qwen3.8-Max的API价格为每百万Token输入2美元、输出6美元,隐式缓存命中价格为每百万Token 0.25美元。开发者可以通过qwen3.8-max这一模型名称调用,并使用函数调用、结构化输出、上下文缓存以及内置搜索工具。
普通用户则可以直接通过Qwen Studio体验,Qoder和Qwen Code等编程工具也已经开始接入。
更值得关注的是,Qwen团队宣布将在正式发布后的一周内开放Qwen3.8-Max权重,同时还将发布Qwen3.8-27B开放权重模型,这将是千问Max级旗舰模型首次走向开放权重。
但“开放权重”并不完全等同于“完全开源”。模型权重可以下载,并不意味着训练数据、完整训练流程和所有工程代码都会公开。截至8月4日,Qwen3.8-Max的具体许可证和最终模型卡仍有待正式发布。
写在最后
Qwen3.8-Max真正值得关注的地方,不是2.4万亿参数,也不是某一张跑分表上的第一名。
它代表着大模型竞争正在发生一次转向。

过去,我们希望AI能把一道题回答得更好;现在,我们开始要求它接过一个目标,在数百次操作、多个工具和不断变化的结果之间,把事情真正做完。
当然,一次连续16天的官方演示,并不意味着企业已经可以放心地把生产系统完全交给AI。权限控制、错误回滚、过程审计、成本管理和人工确认,依然决定了一个智能体能否真正投入使用。官方展示的长周期案例和跑分,也需要更多第三方复现与真实业务验证。
但至少,下一轮竞争的方向已经变得清晰。
未来决定一个模型价值的,可能不再只是它在一分钟内能给出多聪明的答案,而是在离开人类的持续提醒之后,它还能可靠地工作多久。
当AI从回答问题走向承担任务,我们距离真正的“数字同事”配资概念股票,或许又近了一步。
博易股票提示:文章来自网络,不代表本站观点。