新智元报道
编辑:KingHZ 艾伦
【新智元导读】DeepSeek最新模型DeepSeek-V3.1-Terminus来了!此前在输出中随机掺入「极」字的问题得到解决,Humanity's Last Exam成绩也较V3.1提升1/3!Terminus这个名字是否在暗示DeepSeek-V4也快要来了?
DeepSeek-V3.1-Terminus来了!
DeepSeek API文档、官方微信均已正式确认本次更新:
此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:
· 语言一致性:缓解了中英文混杂、偶发异常字符等情况;
· Agent能力:进一步优化了Code Agent与Search Agent的表现。
目前,官方App、网页端、小程序与DeepSeek API模型均已同步更新为DeepSeek-V3.1-Terminus。
开源版本下载地址如下:
Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus
ModelScope:https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus
多项测评胜过Gemini 2.5 Pro
在理能力和智能体工具使用上,本次更新在多个基准上得到提升。
DeepSeek上次更新为8月21日,短短一个月,取得这一成绩来之不易,可喜可贺。
值得一提的是,新模型在Humanity's Last Exam(人类最后的考试)中,成绩提升幅度高达36.48%!
告别「极你太美」
之前,有网友发现:DeepSeek V3.1输出中随机带有「极」字。网友称:
这一Bug已经导致DeepSeek V3.1无法从事编程或对输出结构敏感的相关工作。希望官方早日修复。
这次更新明确已解决「偶发异常字符等情况」,结合「Code Agent优化」,希望这次更新能完美解决DeepSeek无法从事编程或对输出结构敏感的相关工作的Bug。
至于中英文混杂,是LLM的老毛病了,比如OpenAI o3-mini等模型被曝使用中文推理。
在DeepSeek-R1的Nature论文中,DeepSeek坦言:
语言混杂(language-mixing)问题,留待未来更新解决。
这次DeepSeek更新解决了中英文混杂问题。
我们也对之前在网上流传最广的会触发「极你太美」Bug的Prompt进行了测试:
之前,time.Second会被DeepSeek-V3.1在输出中破坏成time.Se极 / time.Se極 / time.Seextreme。
现在,新模型给出了5种定时器实现方法,多处都使用了time.Second。
我们经过多次尝试,均未能复现出该Bug,说明Bug确实可能已经被修复了。
此外,非Agent(Thinking模式)测评中,多项基准测试成绩得到提升:MMLU-Pro、GPQA-Diamond、Humanity's Last Exam。
同时,Agent相关测评也来了。
图源:https://x.com/karminski3/status/1970129020382826758
Agent能力超过Gemini
与DeepSeek-V3.1相比,新模型在工具使用与Agent任务中的表现有较大提升:
BrowseComp:30.0 -> 38.5
SimpleQA:93.4 -> 96.8
SWE-bench Verified: 66.0 -> 68.4
SWE-bench Multilingual: 54.5 -> 57.8
Terminal-bench: 31.3 -> 35.7
DeepSeek上次更新发布了DeepSeek-V3.1,称之为「迈向Agent时代第一步」。
短短一个月,Agent能力再次得到提升,年底的高级Agent还会远吗?
奇怪的是,并非全部基准测试成绩都得到提升,Codeforces、Aider-Polypglot、BrowseComp测评成绩有1%左右的小幅下降。
不过,新模型DeepSeek-V3.1-Terminus总体上进步明显,特别是在Humanity's Last Exam、LiveCodeBench、SimpleQA、SWE-bench Verified评测中,胜过了Gemini 2.5 Pro,补齐了Humanity's Last Exam这块最大的短板。
DeepSeek-V4/R2还远吗?
Terminus这个单词的中文意思是:终点。
在计算机术语中,终端(Terminal)也称终端设备,是计算机网络中处于网络最外围的设备,主要用于用户信息的输入以及处理结果的输出等。
或许,DeepSeek借用Terminus暗指编程能力的提升。
DeepSeek这波更新理所应当地引起了网友的关注。网友在线催更:
DeepSeek-V4什么时候要来?
DeepSeek-R2什么时候要来?
期待DeepSeek-V4和DeepSeek-R2给我们带来更大的震撼!
参考资料:
https://x.com/deepseek_ai/status/1970117808035074215
https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus
https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus
《千赢国际最新官网》,《P6F3X2M7T9QJ8L1B4WZR》bet9手机下载
“彩e”
免费百家乐
……
09月21日
“乐橙AG”磕到了鸣潮和原神的CP
↓↓↓
09月21日,中国光大集团股份公司原党委书记、董事长李晓鹏受贿案一审开庭,顶级官方赌场官网,亿博足球,美高梅官方网站可靠吗,凤凰彩票app下载
09月21日,改革为人民|助力“通道经济” 总书记关注“数智”港口建设,澳洲杯,天博平台怎么样知乎,江南官方体育网页版,球探体育即时
09月21日,【世界说】外媒:受多重因素打击 “美元霸权”或失去根本依托,德扑网,9570登录入口,188宝金博手机版注册,ag平台游戏在线
09月21日|时政Vlog丨我飞了31小时抵达秘鲁利马!大洋彼岸APEC氛围拉满|快三平台页面|365官网唯一大品牌|wepoker群俱乐部|银河赌场网站
09月21日|大力培育“土”工匠,绘就乡村新画卷|万博官网登录页面在哪|申博官网|365sport365|葡京轮盘官方网官网入口
09月21日|天府评论:耕好“无形良田”让希望的田野更加充满希望|乐鱼平台官网|必博最新版APP|澳门线上网投平台怎么样|奥门新匍京官网手机登录……
09月21日,导游师傅“解密”北京话“窍门儿”,台湾大学生串胡同秒变“北京人儿”!,博亚体育APP官网入口,九州体育bet注册,女篮欧洲杯比分,永利客户端下载
09月21日,高原上的AI,真钱电玩,365bet官网大品牌,皇冠体育登陆,欧宝官方网
09月21日|事关2024年国家药品目录调整 国家医保局公开征求意见|m6米乐官方登录入口|365bet体育网址|m5彩票网|北斗娱乐棋牌
09月21日,储蓄国债热度高 财政部回应“一债难求”,澳门十大信誉网站排行榜,买球网站注册,球探即时足球比分,鸭博下载
09月21日,九幅“字画像”读懂2024全国两会热话题,msports万博登录不了,钻石娱乐网址,百姓彩票登录平台,京港地铁官网
09月21日,移动互联网十年 年轻人大厂围城,威尼斯人官网手机网页,澳门永利官方电子,乐鱼体育最新资讯,币游app是什么
09月21日|2023年中国服务进出口额同比增长10%|w88优德体育官网|58国际真人龙虎|乐鱼登陆注册|网赌最正规的平台
09月21日|中疾控:中国急性呼吸道传染病总体处于相对低流行水平|体育彩票投注网站|九州体育网登录|能买外围的足球app|华夏彩票平台登录
09月21日|河南新县:舂锤声响 “年味”飘香|金宝博188官方网站|电玩城可上下分捕鱼|天豪棋牌抢庄牛牛|亚博网址
网友称农村压岁钱畸形攀比严重,酒店代订服务省钱背后都有啥风险|边境线上“草原精灵”的守护者|尊龙手机版登录|澳门金沙彩票平台|bet9九州手机入口|环球娱乐官网
监制:邓金木
策划:赖晗
主创:唐征宇 林箴贺 陈佛烘 颜亦阳 陈林韵
编辑:王家菁、段圣祺