商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > DeepSeek V4-Flash补上"眼睛":多模态实验版上线,Opus 4.8被追平

DeepSeek V4-Flash补上"眼睛":多模态实验版上线,Opus 4.8被追平

  发布于2026-08-22 阅读(0)

扫一扫,手机访问

8月21日,DeepSeek给V4-Flash补上了"眼睛":多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp上线并开放API,但仍是实验版本,用户需要在调用时手动指定模型名称(deepseek-v4-flash-vision-exp)才能访问。最新本次没有提及网页端和App的开放安排。

新模型可以读取截图中的文字、理解图表和页面布局,也能把图片与文字指令放在同一次任务中处理。这意味着智能体不必再让人"用文字描述图片"。对需要查看网页、分析界面、整理图文资料的Agent来说,这是一次能力补齐。

与Opus 4.8互有胜负

DeepSeek公布的对比数据显示,V4-Flash-Vision-Exp在多个Agent benchmark上与Anthropic的Claude Opus 4.8互有胜负:

领先项:DeepSWE(59.3 vs 58.0)、Agents' Last Exam(27.3 vs 25.7)、ZeroBench(35.0 vs 34.0)追平项:Terminal Bench 2.1(83.9 vs 85.0)、Toolathlon-Verified(75.9 vs 76.2)、Chartography(64.3 vs 65.0)落后项:NL2Repo(57.7 vs 69.7)、DSBench-Hard(63.6 vs 71.7),差距在8-12分

DeepSeek V4-Flash补上眼睛:多模态实验版上线,Opus 4.8被追平

与自家文本版DeepSeek V4-Flash-0731对比,视觉版在纯文本任务上基本持平,但在需要看图的多模态测试上大幅领先:ApexBench从26.2涨到36.5,Agents' Last Exam从25.2涨到27.3。视觉能力的加入并没有拖累原有的文本表现,这是这次实验版最关键的信号。

视觉不是用来"看图说话"

最新发布的三个演示可不是识图问答这类基础任务:其一是为高净值客户制作西藏自驾游PPT,需呈现出野性、粗粝且具有实拍质感;其二是按照黑蓝深海、玻璃UI、ASCII像素等视觉要素对DeepSeek Harness进行正式重构;还有一个则是制作带有黏土怪物动效的网页Demo。

DeepSeek V4-Flash补上眼睛:多模态实验版上线,Opus 4.8被追平

三个案例的共同点是:模型要先看懂图片、页面结构和设计意图,再调用工具产出PPT或代码。DeepSeek想展示的不是"能看图",而是视觉能力嵌进完整的Agent工作流。

API与计费

API支持三种主流调用格式(Chat Completions、Messages、Responses),图片可以通过链接、Base64或先上传再引用的方式传入。图片会被转换成token计费,一张图最多折算384 tokens,与文字输入统一定价,整体价格与文本版V4-Flash保持一致。

与此同时,Files API也上线了。用户能够先把图片上传至平台,之后在多次请求中通过file_id进行复用,如此一来,便无需反复上传。该接口本身是免费的,但模型每次处理图片所产生的token依然会正常计费。对于那些需要重复分析同一批截图、图表的工作流程而言,此功能主要节省的是带宽,而非推理成本。(易句)

(本文由AI撰文,网易编辑负责校对)

本文转载于:https://www.163.com/tech/article/L4SH7S5F00097U7T.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注