发布于2026-08-22 阅读(0)
扫一扫,手机访问
但就在8月21日,DeepSeek正式发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,API同日开放,手机端的识图模式也开启了体验。

(图片来源:DeepSeek最新)
最新消息显示,DeepSeek-V4-Flash-Vision-Exp在Agent、推理以及世界知识等纯文本能力方面,与V4-Flash正式版不相上下,原本的优势都得以保留。而它真正的变化在于视觉理解能力:在需要视觉理解的Agent基准测试中,新模型较V4-Flash有了大幅提升,最新的表述是「多模态Agent能力已接近Opus-4.8」。

(图片来源:DeepSeek最新)
最新提供了三个演示案例,其中最显眼莫过于PPT 生成:在 Agent 框架下做一份商业定制的西藏自驾游方案,要「野性、原始、探索感」的调性,给出三种带真实定价的方案,配图还得是实拍质感。其余两个分别是重设计正式和生成前端动态特效 Demo。

(图片来源:DeepSeek最新)
至于大家在意的如何调用API,最新也提供了详细的说明,我们只需把 model 参数设为DeepSeek-V4-Flash-Vision-Exp就行。

(图片来源:DeepSeek最新)
此时,图片将按照token进行计费,一张图片最多占据384个token,其单价与V4-Flash完全相同。图片的传入方式,除了常见的base64内联和外部URL,还有同步开放的Files API:只需上传一次图片,后续使用file_id进行引用即可,同一张图片在多个请求中无需重复上传,而且这项服务是免费的。
不过模型名里带着「Exp」,说明这只是实验版本,离正式版还有距离。不过回想V4-Flash前段时间刚在Arena.ai前端编码榜上首次超过Opus 4.8,现在又把视觉理解补上了,小雷觉得DeepSeek今年的节奏确实快。

(图片来源:AI生成)
可以说DeepSeek的短板这次算是补上了,接下来就看 Agent 场景能挖出多少真需求,那才是对它真正的考验。
机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC都将给出答案。
WRC 2026报道团已抵达WRC现场。


售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9