猫眼电影
猫眼电影记者 汤一亮 报道P6F3X2M7T9QJ8L1B4WZR
新智元报道
编辑:KingHZ 艾伦
【新智元导读】DeepSeek最新模型DeepSeek-V3.1-Terminus来了!此前在输出中随机掺入「极」字的问题得到解决,Humanity's Last Exam成绩也较V3.1提升1/3!Terminus这个名字是否在暗示DeepSeek-V4也快要来了?
DeepSeek-V3.1-Terminus来了!
DeepSeek API文档、官方微信均已正式确认本次更新:
此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:
· 语言一致性:缓解了中英文混杂、偶发异常字符等情况;
· Agent能力:进一步优化了Code Agent与Search Agent的表现。
目前,官方App、网页端、小程序与DeepSeek API模型均已同步更新为DeepSeek-V3.1-Terminus。
开源版本下载地址如下:
Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus
ModelScope:https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus
多项测评胜过Gemini 2.5 Pro
在理能力和智能体工具使用上,本次更新在多个基准上得到提升。
DeepSeek上次更新为8月21日,短短一个月,取得这一成绩来之不易,可喜可贺。
值得一提的是,新模型在Humanity's Last Exam(人类最后的考试)中,成绩提升幅度高达36.48%!
告别「极你太美」
之前,有网友发现:DeepSeek V3.1输出中随机带有「极」字。网友称:
这一Bug已经导致DeepSeek V3.1无法从事编程或对输出结构敏感的相关工作。希望官方早日修复。
这次更新明确已解决「偶发异常字符等情况」,结合「Code Agent优化」,希望这次更新能完美解决DeepSeek无法从事编程或对输出结构敏感的相关工作的Bug。
至于中英文混杂,是LLM的老毛病了,比如OpenAI o3-mini等模型被曝使用中文推理。
在DeepSeek-R1的Nature论文中,DeepSeek坦言:
语言混杂(language-mixing)问题,留待未来更新解决。
这次DeepSeek更新解决了中英文混杂问题。
我们也对之前在网上流传最广的会触发「极你太美」Bug的Prompt进行了测试:
之前,time.Second会被DeepSeek-V3.1在输出中破坏成time.Se极 / time.Se極 / time.Seextreme。
现在,新模型给出了5种定时器实现方法,多处都使用了time.Second。
我们经过多次尝试,均未能复现出该Bug,说明Bug确实可能已经被修复了。
此外,非Agent(Thinking模式)测评中,多项基准测试成绩得到提升:MMLU-Pro、GPQA-Diamond、Humanity's Last Exam。
同时,Agent相关测评也来了。
图源:https://x.com/karminski3/status/1970129020382826758
Agent能力超过Gemini
与DeepSeek-V3.1相比,新模型在工具使用与Agent任务中的表现有较大提升:
BrowseComp:30.0 -> 38.5
SimpleQA:93.4 -> 96.8
SWE-bench Verified: 66.0 -> 68.4
SWE-bench Multilingual: 54.5 -> 57.8
Terminal-bench: 31.3 -> 35.7
DeepSeek上次更新发布了DeepSeek-V3.1,称之为「迈向Agent时代第一步」。
短短一个月,Agent能力再次得到提升,年底的高级Agent还会远吗?
奇怪的是,并非全部基准测试成绩都得到提升,Codeforces、Aider-Polypglot、BrowseComp测评成绩有1%左右的小幅下降。
不过,新模型DeepSeek-V3.1-Terminus总体上进步明显,特别是在Humanity's Last Exam、LiveCodeBench、SimpleQA、SWE-bench Verified评测中,胜过了Gemini 2.5 Pro,补齐了Humanity's Last Exam这块最大的短板。
DeepSeek-V4/R2还远吗?
Terminus这个单词的中文意思是:终点。
在计算机术语中,终端(Terminal)也称终端设备,是计算机网络中处于网络最外围的设备,主要用于用户信息的输入以及处理结果的输出等。
或许,DeepSeek借用Terminus暗指编程能力的提升。
DeepSeek这波更新理所应当地引起了网友的关注。网友在线催更:
DeepSeek-V4什么时候要来?
DeepSeek-R2什么时候要来?
期待DeepSeek-V4和DeepSeek-R2给我们带来更大的震撼!
参考资料:
https://x.com/deepseek_ai/status/1970117808035074215
https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus
https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus
??时事1:新濠天地手机网
??09月22日,持续降雨 广西应急部门紧急避险转移人口600人,
“那好,我们去观看,等待奇迹!”有人起哄。
,英皇体育官网。??09月22日,(身边的变化)中蒙边境数千牧民的“电力保姆”: 二十年见证边疆变化,
1、要提高理论水平和政策水平。村干部是党的农村政策的具体执行者,工作对象主要是广大农民。随着传媒的不断发展和农民对自身权益的日益重视与关注,农民依据政策、依法维护自身权益的意识明显提高。党的政策能否在农村基层得到真正落实,直接关系到农村工作的全局和成败。因此、是否熟悉党的农村政策,严格按政策办事,是衡量一个农村干部合格与否的重要标志。因此,农村基层干部一定要通过培训学习,增强政策观念,提高政策水平和依法办事的自觉性,严格执行党的各项方针政策。
,必威手机版官网首页,尊龙凯时人生就是博z6com,天和棋牌苹果版。??时事2:yobet体育app
??09月22日,东西问|彭洁明:金庸小说中隐含哪些中国传统处世道义与人生智慧?,
“锤叔、鸟爷、精璧大爷,你们去找一找看,将那山寻出来,我迈开一步给他破了去。”小不点道。
,幸运快3彩票,初盘足球打水计算公式,ag8游戏登陆。??09月22日,“梦想”号国际邮轮以三亚为母港首航,
“小紫你们快长大,好带着我去山脉深处看一看。”小不点搂着它们的脖子,扑闪着大眼,露出希冀之色。而后,他又开始探索三头幼鸟的原始宝符,研究这个种族独有的神秘力量。
,百家乐真人百家乐,4-澳门三合,宝马线上娱乐网站。??时事3:现金平台app
??09月22日,伊朗外长:遭袭前收到消息,将在“适当时候”回击以色列,
这样的原始宝术一出,这个地方顿时一阵大乱,诸多凶禽猛兽都惶恐,向着四方躲避。但也有凶狂者,更加嗜血,向前扑杀,决定先铲除这个大患。
,新葡萄娱乐官网,K8凯发官网,抢庄牛牛怎么玩儿。??09月22日,八月天宇:“牛郎织女”觅相逢 英仙座流星雨“落凡尘”,
“与我无关,我觉得这件事可能是石子陵做的。”雨蒙一进来,就这样说道,奉了族中宗老的命令,要想方设法洗脱。
,188金博网注册,必赢网投,kok快速登陆。??时事4:完整比分,比分直播
??09月22日,2024暑期档电影票房突破110亿,
不少人一个趔趄,差点栽倒在地上。
,168客户端下载,bobty体育入口最新版,鸿博体育开户网址。??09月22日,2024年上半年云南12315为消费者挽回3800余万元损失,
3、广发乡是边界乡,民风强悍,社情复杂,维稳形势依然严峻。与新田、宁远的周边乡镇关系微妙,村与村之间田土山林纠纷多,村内房头思想严重,挑事端,强出头的小团伙仍然存在。广发人喜欢“大块吃肉,大口喝酒,大声说话”的豪情等等,治安形势不容乐观,务必时常保持清醒头脑,各村一要抓苗头,二要抓整治,三要抓处臵,四要抓责任。综治主任由乡综治办考核。
,美高梅直营网址,cc彩票平台网站,凯发娱乐官网网页版。责编:郭晓林
审核:鞠鹏
责编:廖贻东