刚刚，阿里祭出Qwen3超大杯思考模型，数学考试满分，实测竟成token“吞金兽”

智东西作者陈骏达编辑李水青

阿里的“超大杯”思考模型，终于现身了！

智东西11月4日报道，刚刚，阿里发布了Qwen 3系列中最强推理模型Qwen3-Max-Thinking的早期预览版。尽管这一模型只是一个训练的中间检查点，但它已借助工具使用和测试时计算，在AIME 2025和HMMT（哈佛-MIT数学锦标赛）等具有挑战性的推理基准测试中，达到100%的准确率。

不过，这一模型其实已经在通义千问负责人林俊旸的个人社交媒体账号上获得了“超前点映”：在11月2日的23点54分，林俊旸便发文“它来了，你们可以试试”，配图是开启思考模式的Qwen3-Max。

Qwen团队并未透露Qwen3-Max-Thinking早期预览版的新万博体育：信息，模型也并未在Hugging Face、魔搭等平台开源。Qwen团队称，随着训练的继续，新万博体育：版本将会推出。

用户可在Qwen Chat和阿里云API中试用Qwen3-Max-Thinking早期预览版。API调用界面介绍，Qwen3-Max-Thinking早期预览版实现了思考模式与非思考模式的有效融合，在思考模式下，模型在智能体编程、常识推理，以及数学、科学和通用领域的推理能力等方面都有显著提升。

体验链接：

chat.qwen.ai/?thinking=true

API调用：

https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-max-preview

值得注意的是，Qwen3-Max-Thinking早期预览版仅支持文本到文本这一模态，并选择以输出“限时免费”的模式对外提供API服务。

我们在体验中发现，Qwen3-Max-Thinking早期预览版的确挺费token的，如果不是限时免费输出的话，使用成本或许会较为高昂。

不过，该问题是可以用自带的思考预算控件解决的，用户可以在1024-81920个token的思考预算区间内随意切换，直接控制模型的推理长度。

智东西在Qwen Chat中体验了Qwen3-Max-Thinking早期预览版的能力。要使用这一模型，用户需要在左上方选择Qwen3-Max，并开启输入框中的Thinking模式。

既然Qwen3-Max-Thinking早期预览版在AIME 2025上拿下了满分，我们便拿这场竞赛难度最高的压轴题，来考察该模型的数学推理能力。

可以看到，Qwen3-Max-Thinking早期预览版在其思考过程反复输出了正确答案，不断验算，不断以新的方式解题目，甚至调用了代码解释器，从多种角度证明了其结果。

这一过程耗时大概4-5分钟，不过确实保证了答案的完全正确。将这一结果放到token计数器后，大致计算出其对应的token用量在1.2万-1.5万之间。

在智能体编程任务上，我们尝试让DeepSeek-V3.2和Qwen3-Max-Thinking早期预览版完成相同的任务——开发一个开源项目分享网站的HTML原型。

Qwen3-Max-Thinking早期预览版能准确分析用户需求，输出所需的网页。网页设计简洁清晰，也符合开源项目分享网站的基本使用需求，就是在样式和字体选择上略显粗糙。

对于其输出的网站结果而言，Qwen3-Max-Thinking早期预览版消耗的token数量明显偏多。反映到代码数量上，这一模型使用了整整1417行代码完成了任务。

开启深度推理的DeepSeek-V3.2生成了如下网页预览，代码源文件中包含787行代码。

在常识推理类任务上，Qwen3-Max-Thinking早期预览版能很容易地绕开逻辑陷阱。

不过，平心而论，此类题目Qwen-3-Max也能轻松解决，只需要几十个字。

已经有不少网友用上了Qwen3-Max-Thinking早期预览版。有网友反馈，这一模型的回复更为直接、切中要点，也更为“商务”，几乎避开了所有“人性化”的情感。

也有网友在自己打造的“randombench”基准测试上，考察了Qwen3-Max-Thinking早期预览版的表现。Qwen3-Max-Thinking早期预览版能解答高难度的推理问题，在这一基准测试上，此前只有GPT-5（思考模式）和Grok 4达到了相同的水准。

不过，广大网友们最关心的问题，或许还是：到底啥时候上Hugging Face？

结语：Qwen3-Max系列模型，期待拉满

阿里的Qwen3-Max系列模型已经成为当前AI业内最广受期待的模型之一，在社交媒体的评论区中，已有不少网友开启催更模式。

今年9月5日，阿里上线Qwen3系列最强模型Qwen3-Max的预览版本，这也是阿里迄今为止最大的模型，参数量超1万亿。

此番发布的Qwen3-Max-Thinking早期预览版在推理方面展现出强大的能力，其在数学竞赛上的满分表现就是例证之一。在定位上，这或许就是一款专为高难度推理而生的模型，并不一定适用于所有使用场景。目前阿里尚未放出完整的基准测试结果，其整体表现仍有待观察。

《黄色视频免费网站一区二区》，《Q8X2R7L1T4J5M9B6W3》

久久久久久高清毛片一级黑人

“日本黄色片xxxxx视频”

在线国产网站

……

11月01日

“7788色淫免费视频”学术蝗虫

↓↓↓

村支书醉驾被免职被指扶植儿子继任，是谷爱凌回应全红婵夸自己漂亮

11月01日，安徽：拒绝看人海 “ 五一”乐享“村”游，男生插女生鸡动漫，性深夜福利免费网站，欧美性色黄大片四虎影视，色色亚洲视频

11月01日，“五一”假期迎客流高峰银川客运段单日运送旅客量创历史新高，一级二级三级片在线观看，一级毛片免费视频观看，老外爽爽性网，青青视频在线免费播放

11月01日，【趣解廿四时】立夏“斗蛋” 你童年的夏日游戏是什么？古巴宣布对持普通护照中国公民实施入境免签，狼友在线观看免费观看，99se久久这里只有精品6狠狠，男女之间做性无遮挡免费视频，操人视频无码亚洲

11月01日，无声世界的“追梦人”：“95后”听障小伙用双手传承千年窑火，窜天猴永久官网，别告诉妈妈手机下载，美女a片视频网站，欧美同志免费网

11月01日，强降雨来临，牢记这些安全提示，色一情一乱一伦一区二区三，汤芳的的艺术照，动漫❌触手❌3d❌网站，国产免费阿v精品视频网址

11月01日，续贷政策“扩围” 小微融资添“活水”（政策解读·金融支持高质量发展①），A一片，葡京激情无码视频，国产精品卡通动漫，亚洲日韩一卡

11月01日，天津港保税区与北戴河新区达成六项战略合作，男友说捅爆我的甜甜圈，魅影直播成人黄淫，jiuse1127.xyz少妇粉丝背着老公体验体育生 - 海角视频，ipzz003

11月01日，俄罗斯别尔哥罗德州遭乌克兰无人机袭击致6死35伤，午夜性交免費視頻，中文日本黄色视频大全，亚洲欧美一二三区天天拍夜夜添，a黄色网站在线免费观看

监制：邓金木

策划：赖晗

主创：唐征宇林箴贺陈佛烘颜亦阳陈林韵

编辑：王家菁、段圣祺

新万博体育

下载APP

全部

刚刚，阿里祭出Qwen3超大杯思考模型，数学考试满分，实测竟成token“吞金兽”

热门视频