猫眼电影
猫眼电影记者 薛定谔 报道P6F3X2M7T9QJ8L1B4WZR
新智元报道
编辑:KingHZ 艾伦
【新智元导读】DeepSeek最新模型DeepSeek-V3.1-Terminus来了!此前在输出中随机掺入「极」字的问题得到解决,Humanity's Last Exam成绩也较V3.1提升1/3!Terminus这个名字是否在暗示DeepSeek-V4也快要来了?
DeepSeek-V3.1-Terminus来了!
DeepSeek API文档、官方微信均已正式确认本次更新:
此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:
· 语言一致性:缓解了中英文混杂、偶发异常字符等情况;
· Agent能力:进一步优化了Code Agent与Search Agent的表现。
目前,官方App、网页端、小程序与DeepSeek API模型均已同步更新为DeepSeek-V3.1-Terminus。
开源版本下载地址如下:
Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus
ModelScope:https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus
多项测评胜过Gemini 2.5 Pro
在理能力和智能体工具使用上,本次更新在多个基准上得到提升。
DeepSeek上次更新为8月21日,短短一个月,取得这一成绩来之不易,可喜可贺。
值得一提的是,新模型在Humanity's Last Exam(人类最后的考试)中,成绩提升幅度高达36.48%!
告别「极你太美」
之前,有网友发现:DeepSeek V3.1输出中随机带有「极」字。网友称:
这一Bug已经导致DeepSeek V3.1无法从事编程或对输出结构敏感的相关工作。希望官方早日修复。
这次更新明确已解决「偶发异常字符等情况」,结合「Code Agent优化」,希望这次更新能完美解决DeepSeek无法从事编程或对输出结构敏感的相关工作的Bug。
至于中英文混杂,是LLM的老毛病了,比如OpenAI o3-mini等模型被曝使用中文推理。
在DeepSeek-R1的Nature论文中,DeepSeek坦言:
语言混杂(language-mixing)问题,留待未来更新解决。
这次DeepSeek更新解决了中英文混杂问题。
我们也对之前在网上流传最广的会触发「极你太美」Bug的Prompt进行了测试:
之前,time.Second会被DeepSeek-V3.1在输出中破坏成time.Se极 / time.Se極 / time.Seextreme。
现在,新模型给出了5种定时器实现方法,多处都使用了time.Second。
我们经过多次尝试,均未能复现出该Bug,说明Bug确实可能已经被修复了。
此外,非Agent(Thinking模式)测评中,多项基准测试成绩得到提升:MMLU-Pro、GPQA-Diamond、Humanity's Last Exam。
同时,Agent相关测评也来了。
图源:https://x.com/karminski3/status/1970129020382826758
Agent能力超过Gemini
与DeepSeek-V3.1相比,新模型在工具使用与Agent任务中的表现有较大提升:
BrowseComp:30.0 -> 38.5
SimpleQA:93.4 -> 96.8
SWE-bench Verified: 66.0 -> 68.4
SWE-bench Multilingual: 54.5 -> 57.8
Terminal-bench: 31.3 -> 35.7
DeepSeek上次更新发布了DeepSeek-V3.1,称之为「迈向Agent时代第一步」。
短短一个月,Agent能力再次得到提升,年底的高级Agent还会远吗?
奇怪的是,并非全部基准测试成绩都得到提升,Codeforces、Aider-Polypglot、BrowseComp测评成绩有1%左右的小幅下降。
不过,新模型DeepSeek-V3.1-Terminus总体上进步明显,特别是在Humanity's Last Exam、LiveCodeBench、SimpleQA、SWE-bench Verified评测中,胜过了Gemini 2.5 Pro,补齐了Humanity's Last Exam这块最大的短板。
DeepSeek-V4/R2还远吗?
Terminus这个单词的中文意思是:终点。
在计算机术语中,终端(Terminal)也称终端设备,是计算机网络中处于网络最外围的设备,主要用于用户信息的输入以及处理结果的输出等。
或许,DeepSeek借用Terminus暗指编程能力的提升。
DeepSeek这波更新理所应当地引起了网友的关注。网友在线催更:
DeepSeek-V4什么时候要来?
DeepSeek-R2什么时候要来?
期待DeepSeek-V4和DeepSeek-R2给我们带来更大的震撼!
参考资料:
https://x.com/deepseek_ai/status/1970117808035074215
https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus
https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus
??时事1:男男GAY无套✅浴室视频
??09月20日,国家统计局:2023年全国房地产开发投资110913亿元,
一群强者颤栗,柳树太可怕了,根本就对抗不了,除非禀告族主,亲自而来,不然的话众强在这里纯碎是送死。
,动漫yaoi❤♂Furry漫画。??09月20日,中国贸促会新闻发言人就欧盟发布关于对华电动汽车反补贴初裁结果发表谈话,
“低领域总比这些净土容易一些吧,我打算去走上一遭,听说奖励的那块骨可能是太古遗种级的。”
,亲近相尾女主妈妈,朱竹清被❌到爽🔞高潮痉挛广告,QOSWife2中文汉化版v1.0。??时事2:办公室乳舔孕妇
??09月20日,香港中学生升旗队北京参访:努力把五星红旗扬出漂亮的弧度,
诸强退到了小孤山镇,感觉事情棘手,山脉中的景象太恐怖了,他们根本就不可能进得去,别说山宝,就是遗种的尸体等也根本不可能得到。
,最爽的亂倫老女人,百合les被cao到双腿颤抖,啊老师好硬拔出来日本。??09月20日,中新教育丨天津出台全国首部职业教育产教融合促进条例,
消防不仅仅是火的克星,更是人们心中的救星,哪里有火,哪里就有他们,他们是令人尊敬的…
,动漫男做㊙️视频,第五人格红蝶内裤水+钻进,narutomanga爆乳玖辛奈vk。??时事3:HWDHDHDXⅩXXX69
??09月20日,上半年中国海水养殖产量同比增长超5% 进口海鲜采购链路畅通,
新年伊始,矿上根据xx年的安排,要求机修厂在xx年实现节约500万元利润的经济目标。任务量很重,迫切要求机修厂全体职工统一思想,为实现节约500万元利润想办法,想门路。
,18🈲egg尤妮丝裸体视频,18🈲🍆🍆🍆网站,曼尼哈里斯录像。??09月20日,南方阴雨持续体感湿冷 北方冷空气又将来袭 ,
若是别人的话,肯定是通体龟裂,而后炸碎。即便是手段高超,这条手臂多半也直接碎掉。而石渊宝术惊人,凝固了伤口,虽然半废,但臂膀总算没有碎掉。
,鸣人被佐助🌿的喊停,❌X❌X紧身裤美女视频,13学生的粉嫩小泬洗澡。??时事4:韩国19🈲色情综艺天体野营
??09月20日,“消费返现”骗局再现!有人上当被骗数万元,
古往今来,安全一直是构建和谐社会的永恒主题。一个企业没有安全,就谈不上发展,一个家庭没有安全就失去了幸福。安全对于企业和家庭是同等的重要,所以说,关注安全是我们每个人的义务和责任。在这里,我要引用陇电分公司经理王世健的一幅安全对联来表达我对陇电安全生产齐抓共管良好局面的美好期盼。即:上联是“用责任推进安全生产”;下联是“以和谐构建齐抓共管”;横批是“生命为天”。各位同仁,让我们共同为陇电的安全与发展,切记:安全!安全!再安全!!!在此,我要呼吁各位同仁——安全,从我做起;安全,就从现在做起!
,国产精品❌❌❌🔞🔞10,美女➕光屁屁➕无遮挡韩打针,鸣人哭着求佐助拨出来。??09月20日,春运将至 北京“的士之家”提供暖心服务,
“为什么这样咄咄逼人,难道觉得很强大,可以无视我们的感受了吗,不然怎能如此欺人?!”几位族老也有些怒气。生活在大山中,强大的壮年男子对一个村落来说非常重要,对方竟然这样肆无忌惮,说杀就杀。
,少妇被狂C下部❌羞羞在线观看,小心戳进老师里面,潘娇娇裸体㊙️无遮挡胸。责编:王少锋
审核:周道炯
责编:袁化伟