商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 突发!DeepSeek多模态来了:会做图,不涨价

突发!DeepSeek多模态来了:会做图,不涨价

  发布于2026-08-22 阅读(0)

扫一扫,手机访问

但就在8月21日,DeepSeek正式发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,API同日开放,手机端的识图模式也开启了体验。

微信图片_20260821184757_1694_51.png

(图片来源:DeepSeek最新)

最新消息显示,DeepSeek-V4-Flash-Vision-Exp在Agent、推理以及世界知识等纯文本能力方面,与V4-Flash正式版不相上下,原本的优势都得以保留。而它真正的变化在于视觉理解能力:在需要视觉理解的Agent基准测试中,新模型较V4-Flash有了大幅提升,最新的表述是「多模态Agent能力已接近Opus-4.8」。

微信图片_20260821184649_931_49.jpg

(图片来源:DeepSeek最新)

最新提供了三个演示案例,其中最显眼莫过于PPT 生成:在 Agent 框架下做一份商业定制的西藏自驾游方案,要「野性、原始、探索感」的调性,给出三种带真实定价的方案,配图还得是实拍质感。其余两个分别是重设计正式和生成前端动态特效 Demo。

微信图片_20260821184650_932_49.jpg

(图片来源:DeepSeek最新)

至于大家在意的如何调用API,最新也提供了详细的说明,我们只需把 model 参数设为DeepSeek-V4-Flash-Vision-Exp就行。

微信图片_20260821183507_1693_51.png

(图片来源:DeepSeek最新)

此时,图片将按照token进行计费,一张图片最多占据384个token,其单价与V4-Flash完全相同。图片的传入方式,除了常见的base64内联和外部URL,还有同步开放的Files API:只需上传一次图片,后续使用file_id进行引用即可,同一张图片在多个请求中无需重复上传,而且这项服务是免费的。

不过模型名里带着「Exp」,说明这只是实验版本,离正式版还有距离。不过回想V4-Flash前段时间刚在Arena.ai前端编码榜上首次超过Opus 4.8,现在又把视觉理解补上了,小雷觉得DeepSeek今年的节奏确实快。

image.png

(图片来源:AI生成)

可以说DeepSeek的短板这次算是补上了,接下来就看 Agent 场景能挖出多少真需求,那才是对它真正的考验。

机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。

宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!

所有关于机器人的核心问题,WRC都将给出答案。

WRC 2026报道团已抵达WRC现场。

导流版本.png

稿定设计-6.png

本文转载于:https://www.leikeji.com/article/78871 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注