国际象棋真人动作 社会频“道 946”8人关注_新万博体育

新万博体育

图片
搜索
猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4_R2还远吗?

2025-09-22 08:59:37
来源:

猫眼电影

作者:

罗伯特·卡林

手机查看

  猫眼电影记者 汤一亮 报道P6F3X2M7T9QJ8L1B4WZR

新智元报道

编辑:KingHZ 艾伦

【新智元导读】DeepSeek最新模型DeepSeek-V3.1-Terminus来了!此前在输出中随机掺入「极」字的问题得到解决,Humanity's Last Exam成绩也较V3.1提升1/3!Terminus这个名字是否在暗示DeepSeek-V4也快要来了?

DeepSeek-V3.1-Terminus来了!

DeepSeek API文档、官方微信均已正式确认本次更新:

此次更新在保持模型原有能力的基础上,针对用户反馈的问题进行了改进,包括:

· 语言一致性:缓解了中英文混杂、偶发异常字符等情况;

· Agent能力:进一步优化了Code Agent与Search Agent的表现。

目前,官方App、网页端、小程序与DeepSeek API模型均已同步更新为DeepSeek-V3.1-Terminus。

开源版本下载地址如下:

Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus

ModelScope:https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus

多项测评胜过Gemini 2.5 Pro

在理能力和智能体工具使用上,本次更新在多个基准上得到提升。

DeepSeek上次更新为8月21日,短短一个月,取得这一成绩来之不易,可喜可贺。

值得一提的是,新模型在Humanity's Last Exam(人类最后的考试)中,成绩提升幅度高达36.48%!

告别「极你太美」

之前,有网友发现:DeepSeek V3.1输出中随机带有「极」字。网友称:

这一Bug已经导致DeepSeek V3.1无法从事编程或对输出结构敏感的相关工作。希望官方早日修复。

这次更新明确已解决「偶发异常字符等情况」,结合「Code Agent优化」,希望这次更新能完美解决DeepSeek无法从事编程或对输出结构敏感的相关工作的Bug。

至于中英文混杂,是LLM的老毛病了,比如OpenAI o3-mini等模型被曝使用中文推理。

在DeepSeek-R1的Nature论文中,DeepSeek坦言:

语言混杂(language-mixing)问题,留待未来更新解决。

这次DeepSeek更新解决了中英文混杂问题。

我们也对之前在网上流传最广的会触发「极你太美」Bug的Prompt进行了测试:

之前,time.Second会被DeepSeek-V3.1在输出中破坏成time.Se极 / time.Se極 / time.Seextreme。

现在,新模型给出了5种定时器实现方法,多处都使用了time.Second。

我们经过多次尝试,均未能复现出该Bug,说明Bug确实可能已经被修复了。

此外,非Agent(Thinking模式)测评中,多项基准测试成绩得到提升:MMLU-Pro、GPQA-Diamond、Humanity's Last Exam。

同时,Agent相关测评也来了。

图源:https://x.com/karminski3/status/1970129020382826758

Agent能力超过Gemini

与DeepSeek-V3.1相比,新模型在工具使用与Agent任务中的表现有较大提升:

BrowseComp:30.0 -> 38.5

SimpleQA:93.4 -> 96.8

SWE-bench Verified: 66.0 -> 68.4

SWE-bench Multilingual: 54.5 -> 57.8

Terminal-bench: 31.3 -> 35.7

DeepSeek上次更新发布了DeepSeek-V3.1,称之为「迈向Agent时代第一步」。

短短一个月,Agent能力再次得到提升,年底的高级Agent还会远吗?

奇怪的是,并非全部基准测试成绩都得到提升,Codeforces、Aider-Polypglot、BrowseComp测评成绩有1%左右的小幅下降。

不过,新模型DeepSeek-V3.1-Terminus总体上进步明显,特别是在Humanity's Last Exam、LiveCodeBench、SimpleQA、SWE-bench Verified评测中,胜过了Gemini 2.5 Pro,补齐了Humanity's Last Exam这块最大的短板。

DeepSeek-V4/R2还远吗?

Terminus这个单词的中文意思是:终点。

在计算机术语中,终端(Terminal)也称终端设备,是计算机网络中处于网络最外围的设备,主要用于用户信息的输入以及处理结果的输出等。

或许,DeepSeek借用Terminus暗指编程能力的提升。

DeepSeek这波更新理所应当地引起了网友的关注。网友在线催更:

DeepSeek-V4什么时候要来?

DeepSeek-R2什么时候要来?

期待DeepSeek-V4和DeepSeek-R2给我们带来更大的震撼!

参考资料:

https://x.com/deepseek_ai/status/1970117808035074215

https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Terminus

https://modelscope.cn/models/deepseek-ai/DeepSeek-V3.1-Terminus

??时事1:新濠天地手机网

??09月22日,持续降雨 广西应急部门紧急避险转移人口600人,

  “那好,我们去观看,等待奇迹!”有人起哄。

,英皇体育官网。

??09月22日,(身边的变化)中蒙边境数千牧民的“电力保姆”: 二十年见证边疆变化,

  1、要提高理论水平和政策水平。村干部是党的农村政策的具体执行者,工作对象主要是广大农民。随着传媒的不断发展和农民对自身权益的日益重视与关注,农民依据政策、依法维护自身权益的意识明显提高。党的政策能否在农村基层得到真正落实,直接关系到农村工作的全局和成败。因此、是否熟悉党的农村政策,严格按政策办事,是衡量一个农村干部合格与否的重要标志。因此,农村基层干部一定要通过培训学习,增强政策观念,提高政策水平和依法办事的自觉性,严格执行党的各项方针政策。

,必威手机版官网首页,尊龙凯时人生就是博z6com,天和棋牌苹果版。

??时事2:yobet体育app

??09月22日,东西问|彭洁明:金庸小说中隐含哪些中国传统处世道义与人生智慧?,

  “锤叔、鸟爷、精璧大爷,你们去找一找看,将那山寻出来,我迈开一步给他破了去。”小不点道。

,幸运快3彩票,初盘足球打水计算公式,ag8游戏登陆。

??09月22日,“梦想”号国际邮轮以三亚为母港首航,

  “小紫你们快长大,好带着我去山脉深处看一看。”小不点搂着它们的脖子,扑闪着大眼,露出希冀之色。而后,他又开始探索三头幼鸟的原始宝符,研究这个种族独有的神秘力量。

,百家乐真人百家乐,4-澳门三合,宝马线上娱乐网站。

??时事3:现金平台app

??09月22日,伊朗外长:遭袭前收到消息,将在“适当时候”回击以色列,

  这样的原始宝术一出,这个地方顿时一阵大乱,诸多凶禽猛兽都惶恐,向着四方躲避。但也有凶狂者,更加嗜血,向前扑杀,决定先铲除这个大患。

,新葡萄娱乐官网,K8凯发官网,抢庄牛牛怎么玩儿。

??09月22日,八月天宇:“牛郎织女”觅相逢 英仙座流星雨“落凡尘”,

  “与我无关,我觉得这件事可能是石子陵做的。”雨蒙一进来,就这样说道,奉了族中宗老的命令,要想方设法洗脱。

,188金博网注册,必赢网投,kok快速登陆。

??时事4:完整比分,比分直播

??09月22日,2024暑期档电影票房突破110亿,

  不少人一个趔趄,差点栽倒在地上。

,168客户端下载,bobty体育入口最新版,鸿博体育开户网址。

??09月22日,2024年上半年云南12315为消费者挽回3800余万元损失,

  3、广发乡是边界乡,民风强悍,社情复杂,维稳形势依然严峻。与新田、宁远的周边乡镇关系微妙,村与村之间田土山林纠纷多,村内房头思想严重,挑事端,强出头的小团伙仍然存在。广发人喜欢“大块吃肉,大口喝酒,大声说话”的豪情等等,治安形势不容乐观,务必时常保持清醒头脑,各村一要抓苗头,二要抓整治,三要抓处臵,四要抓责任。综治主任由乡综治办考核。

,美高梅直营网址,cc彩票平台网站,凯发娱乐官网网页版。

责编:郭晓林

审核:鞠鹏

责编:廖贻东

相关推荐 换一换