商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > DeepSeek V4定档7月中旬,峰谷API定价同步落地

DeepSeek V4定档7月中旬,峰谷API定价同步落地

  发布于2026-08-22 阅读(0)

扫一扫,手机访问

DeepSeek最近的动作密度相当高,产品迭代和技术开源两条线几乎是在同步提速。正式版V4已确定7月中旬上线,届时API会启动峰谷定价机制,高峰时段价格直接翻倍。与此同时,联合北京大学推出的推理加速框架DSpark也已全量部署到线上服务,单用户生成速度最高提升了85%。两件事放在一起看,传递的信号很清晰:这家公司正在把商业化压力管理和技术能力兑现这两件事,同时往前推。

6月29日,DeepSeek团队正式宣布了V4正式版的发布时间——7月中旬,同步上线的还有峰谷定价策略。从公布的价格表来看,高峰时段API价格是平时的两倍,平时价格与现行V4 API价格保持一致。高峰时段的定义也很具体:每天上午9点到12点、下午2点到6点。公司方面的解释是,这样做能更合理配置资源,提升服务稳定性。

技术层面同样有重量级动作。6月27日,DeepSeek联合北京大学发布了推理加速框架DSpark,并将全栈推测性解码工具链DeepSpec同步开源。论文由创始人梁文锋本人署名,已上传至公开代码库。实测数据很亮眼:DSpark部署后,V4-Flash单用户生成速度提升了60%至85%,V4-Pro提升了57%至78%,效果已在线上服务全量验证。这也是DeepSeek完成500亿元融资后,首次对外发布的开源技术成果。

对于API用户来说,峰谷定价意味着工作时段使用成本会明显上升;对于开发者而言,推理速度的显著提升或许能在高并发场景下部分对冲成本压力,同时也进一步降低了推理优化的落地门槛。


V4正式版上线与峰谷定价机制

DeepSeek V4模型的预览版是在4月24日上线并同步开源的,拥有百万字超长上下文,在Agent能力、世界知识和推理性能上都处于国内及开源领域领先位置。正式版计划7月中旬推出,预计会带来进一步的功能优化和性能提升。

V4系列这次分成了两个规格:旗舰版V4-Pro总参数达到1.6万亿,激活参数49B,预训练数据量33T,支持1M上下文,网页端以专家模式运行;轻量版V4-Flash总参数284B,激活参数13B,预训练数据32T,同样支持1M上下文,网页端以快速模式运行。两款模型都已完成开源并提供API服务。


峰谷定价是这次正式版更新的另一个核心变量。它将每日API使用成本切分为两个层级,平时价格维持现行水平不变,高峰时段收费翻倍。对于在工作时段密集调用API的企业用户来说,成本影响会相当直接;而那些有条件将批量任务迁移至低峰时段运行的用户,则可以在定价调整后维持原有的成本水平。

DSpark:推测性解码的工程化落地

DSpark并非一个全新架构的模型,而是在现有V4模型基础上引入了推测性解码模块,核心在于工程层面的优化落地。推测性解码的基本逻辑很直观:先由轻量级小模型快速生成候选token(相当于草稿),再由大模型并行验证,接受符合目标分布的连续前缀,这样就能在不损失生成质量的前提下显著提速。


DSpark针对这一技术路线在实际落地中的两个核心瓶颈,给出了针对性的方案。

第一个瓶颈是半自回归生成架构,主要解决并行草稿的"后缀衰减"问题——当并行独立生成各位置token时,位置之间缺乏依赖约束,越往后错误累积越严重,验证接受率会断崖式下跌。DSpark采用了"并行主干+轻量串行头"的两阶段设计:并行主干保留速度优势,串行模块则补充相邻token间的依赖关系,修正语义冲突,直接提升每轮验证的有效接受长度。测试结果显示,2层深度的DSpark有效接受长度甚至超过了5层深度的纯并行方案DFlash。


第二个瓶颈是置信度调度验证机制,主要针对全量验证导致的算力浪费问题。DSpark在草稿模型上增加了置信度评分模块,实时预测每个候选token的条件接受概率,并通过"顺序温度缩放"校准方法把评分误差从3%-8%压缩到大约1%。在此基础上,调度器根据实时负载动态调整验证长度:低并发时拉满算力,高并发时主动裁剪低价值token,避免资源争抢和速度骤降。

本文转载于:https://www.163.com/dy/article/L0K5NGUM05198NMR.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注