当前位置:

首页 > 硬件相关 > DeepSeek Harness开启内测?看来V4正式版也不远了

DeepSeek Harness开启内测?看来V4正式版也不远了

从2026年3月崔添翼加入DeepSeek、开始组建Harness团队算起,这场“憋大招”已经持续了整整五个月。如今,DeepSeek的Harness工具,终于要揭开面纱了?一张截图正在各大AI社区疯传,内容正是DeepSeek Harness的内部测试招募通知。按照截图中的说法,Harness计划

从2026年3月崔添翼加入DeepSeek、开始组建Harness团队算起,这场“憋大招”已经持续了整整五个月。如今,DeepSeek的Harness工具,终于要揭开面纱了?

一张截图正在各大AI社区疯传,内容正是DeepSeek Harness的内部测试招募通知。



按照截图中的说法,Harness计划于本周晚些时候启动内测,首批用户将从一个小范围群组中筛选。入选者不仅要提交个人资料,还得签署一份《保密承诺函》,才能拿到产品的访问权限。

更关键的是,一旦泄密,后果不光是本次测试资格被取消,还会影响到日后DeepSeek各类模型、产品内测以及合作机会的入选。

虽然截图的真伪眼下无法验证,但结合DeepSeek此前关于V4正式版发布日期的公告,以及崔添翼曾明确表示Harness将和V4同时发布,这条传闻靠谱的可能性相当大。

不过,目前市面上没有任何关于DeepSeek Harness产品形态的报道。以DeepSeek一向的作风,Harness作为重要产品,其研发与设计必然是严格保密的。

但别急,我们还是能通过DeepSeek留下的各种蛛丝马迹,大致勾勒出这个产品可能的样子。

01 DeepSeek Harness到底长什么样

DeepSeek Harness究竟长什么样?目前公开的信息只有两块:第一块是负责人崔添翼的量化背景,第二块是DeepSeek关于Harness部分的招聘职位描述(JD)。

先来说第一块。崔添翼不是做AI出身的,他之前在Jane Street做了九年的量化交易系统。

在量化交易系统里,最值钱的是执行系统。它讲究的是软件能否在毫秒级别把策略变成交易?能否在出现异常时自动恢复?能否在每一步都留下可追溯的日志?

如果把这种思维搬到Harness上,那么其大体逻辑可能会是这样的——

量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。对应到Harness,Agent循环的每一轮“推理-执行-反馈”都要快,不能有冗余开销。你跟AI说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、再到想下一步,整个循环必须得流畅。

同时,量化系统必须得极其可靠。如果系统崩了,亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。



放到Harness上,道理也很直白:模型可能会犯错,甚至输出一些离谱的东西,但Harness这个框架本身不能崩。它得能兜住结果,想办法把模型拉回来继续干活。

其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死机,得有重试、有备用方案,实在不行就降级。比如实时行情拿不到,就先用延迟数据顶着。

模型也是一个道理:调用工具失败了、文件读不出来、网络超时了,这些都是常事。一个好的Harness,不会因为一个工具调用失败就让整个任务废掉。它会自动重试、换个方法,实在不行就降级处理,继续推进任务。

由于量化系统涉及大量金钱,交易出问题了,得能查出是哪一步出的错——可能是下单时错了,也可能是行情解析时错了。每一步都得有日志,才能复盘。

Harness也一样。AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?

在整个量化系统里,订单状态也非常重要。不能出现“我以为下单了但其实没下”或者“重复下单”的情况,每一步的状态都得是确定的、一致的。

放到Harness上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个Harness的成功率。不能前面改了A文件,后面改B文件的时候就把A的改动忘了。

最后是风控和安全。量化交易有熔断机制,行情异常时自动停止交易,防止一个bug把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。

那么回到Harness里,在让AI删文件、格式化硬盘、跑“sudo rm -rf”这种高危操作之前,就必须得停下来进行确认。不能让它想干啥就干啥,Harness得有个安全闸门。

02 从DeepSeek的JD里看产品

说完了第一块,再来说第二块——DeepSeek最新挂出来的岗位JD。

JD里提到了KV Cache、长上下文裁剪与压缩算法,这说明Harness会做智能的上下文管理。

配合DeepSeek V4的前缀缓存能力,相同上下文的任务可以做到不重复计算。长对话中自动对历史消息做摘要,保留关键信息,释放token空间。根据任务复杂度动态调整上下文策略,简单任务用短上下文省成本,复杂任务则可以拉满百万token的长上下文。



这相当于把每一份算力都花在刀刃上:小事能省则省,大事算力拉满。

JD里还提到了向量存储方案选型、会话状态持久化与回放。这也就意味着,Harness拥有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目时自动加载。

会话持久化,代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至DeepSeek Harness还可能记住你的命名风格、喜欢的框架版本,跨对话记忆你的各种习惯。

JD里提到了Tool Use链式调用、错误回退与自动重试。这指的是Harness拥有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。

划重点,DeepSeek Harness还可能支持动态注册新工具,Agent能自动发现并学会使用。

JD里提到了多Agent间通信协议设计、任务分解与结果聚合。这说明Harness有子Agent架构:一个主Agent负责任务规划和协调,多个子Agent负责具体执行。

不同子Agent有不同的系统提示词、工具权限、上下文窗口。主Agent把复杂任务拆成子任务,分发给子Agent,再把结果聚合成最终输出。每个子Agent运行在独立上下文或进程中,互不干扰,出错了也不影响主流程。

JD里还提到了任务规划图生成、执行路径在线优化。这意味着Harness具备规划与自进化的能力。

规划说的是接到任务后,先生成执行计划:分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。

而且,DeepSeek Harness很可能有一套内部benchmark,每次架构改动都跑一遍,看是进步了还是退步了,以此实现工具的自我进化。

最有意思的一点在JD最后:DeepSeek说,要让模型与Harness共同进化,实现模型与Harness的深度适配。

这也就意味着,Harness会利用DeepSeek-V4模型的特性,比如V4的稀疏注意力、前缀缓存。它不是通用的Harness框架,而是跟DeepSeek模型深度绑定的一体化产品。

其实这也是OpenAI现在正在践行的理念。

此前,OpenAI有两条独立的后训练线:一条是代码专用的Codex线,一条是通用推理的GPT线。到GPT-5.5的时候,两条线合并了,GPT-5.5-Codex将代码能力和通用推理能力整合进了同一个模型。

这就好比汽车。原厂就像汽车厂家自己做发动机加变速箱,知道发动机的扭矩曲线和转速特性,变速箱换挡逻辑可以精准匹配。但如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,结果永远调不到原厂那么丝滑。

03 V4正式版,跳票一个月

Harness不是一个人来的。崔添翼曾表示,V4正式版和Harness将同步发布。

4月24日,DeepSeek发布V4 Preview,Pro和Flash两个版本同步开源。两个月后,6月29日,DeepSeek向API用户发送邮件,明确说V4正式版计划于7月中旬上线。结果眼瞅着要到8月了,依然没有任何关于V4正式版的消息。

曾有传闻称,由于7月24日,DeepSeek旧的API(deepseek-chat和deepseek-reasoner)正式退役,所以V4正式版将会同期发布。毕竟更换API接口,通常是给新版本让路的前置动作。

可V4正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的deepseek-v4-flash和deepseek-v4-pro。换句话说,API接口名换了,但模型本身还是预览版那套。

那么正式版比预览版到底强在哪?

综合多个内测信源的说法,V4正式版在三个方向上做了升级:

核心推理能力再上一个台阶。

日常对话的响应速度明显优化。

Agent能力针对性迭代。

有参与灰度测试的人总结,V4正式版整体表现接近Opus 4.8级别,编码能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同样的任务,比Claude Fable 5迭代轮数还少。



不过这些说法都来自非最新渠道,DeepSeek没有公开确认。

预览版的问题,其实社区里讨论得不少。V4 Preview在编程能力上和Kimi K2.7、GLM 5.1接近,但仍然逊色于当前的主流模型。

尤其是在那些复杂的任务上。有测试者发现,即便要求模型“不使用外部依赖”,模型依然引用了外部CDN。

遇到真正复杂的任务,需要手动加“reasoning_effort=max”(推理强度最高)才能拿到更深的思考深度,但变成Agent时往往会忽略这个提示词,导致模型思考的强度不够。

还有一点,虽然目前DeepSeek已上线识图模式(OCR),不过DeepSeek-V4的多模态能力依然是短板。

按照DeepSeek最新的说法,预览版是纯文本,正式版将首次原生支持图像推理,DeepThink引擎可以在同一个思考流程中分析图片、解读截图。这变相也给Harness工具增加了压力。

以及V4正式版会加入一些企业功能,但具体如何,DeepSeek最新并没有进一步透露。

再说价格,这是争议最大的部分。

V4正式版将引入峰谷定价机制,高峰时段(北京时间9:00-12:00和14:00-18:00)API价格直接翻倍。具体来看,V4 Pro缓存命中输入平时0.025元/百万token,高峰0.05元;缓存未命中平时3元,高峰6元;输出平时6元,高峰12元。V4 Flash缓存命中平时0.02元,高峰0.04元;缓存未命中平时1元,高峰2元;输出平时2元,高峰4元。

峰谷定价这件事,往好了说是把算力选择权还给用户:不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。

这不是DeepSeek第一次在定价上换思路。

2025年2月搞过夜间错峰优惠,V3五折、R1二五折。2025年9月V3.1发布,取消夜间优惠,全天统一价,输出价格还往上抬了50%。

但关键问题不在于价格涨没涨,而在于结合Harness之后,整体使用成本会如何?

第三方测试显示,不同的Harness在完成同样任务时,token消耗差异巨大。测试机构用DeepSeek V4 Flash,分别测试了Claude Code、OpenCode和Pi这三个市面上最常见的Harness工具。结果发现,三种工具的代码质量基本一致,但Claude Code每个任务平均跑约70次工具调用,OpenCode只有约22次。

此外,同一个任务,在弱Harness(Pi)里失败了,换到强Harness(Claude Code)里居然成功了。

因此,如何平衡价格与性能,这是DeepSeek做Harness必须要面对的问题。

不过有一点倒是可以放心:在省钱这件事上,梁文锋还是太权威了。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。