中国人工智能实验室 DeepSeek 悄然推出了deepseek-v4-flash-vision-exp,这是其 V4-Flash 模型的实验版本,可以接受图像和文本,弥补了其旗舰模型系列中最明显的差距之一。该版本在 V4-Flash-0731 和 V4-Pro-0813 更新几周后发布,记录在该公司的官方 API 页面上,为开发人员提供了一种长期要求的方式,可以将屏幕截图、图表和照片直接输入业界最便宜的前沿模型之一。对于追踪最新人工智能发展的团队来说,这是另一个信号,表明 DeepSeek 打算在功能上与西方竞争对手匹敌,同时在价格上大幅降低他们的价格。
新模型的作用
根据 DeepSeek 的 API 文档,“deepseek-v4-flash-vision-exp”允许用户“要求模型描述图片、从屏幕截图中读取文本、分析图表等等”。该模型接受 JPEG、PNG、GIF 和 WebP 文件,其格式是从实际文件内容检测到的,而不是文件名或声明的 MIME 类型——这是一个小但深思熟虑的细节,可以防止扩展名不匹配的错误。
开发人员可以通过三种方式传递图像:base64 编码的内联数据 URL(受 48 MiB 请求正文限制)、可公开访问的外部 URL(最多 8,192 个字符,每个图像 32 MiB,具有 60 秒的下载窗口)或通过文件 API。一切都使用标准的 OpenAI 兼容的聊天完成格式,并且该模型也可以通过 DeepSeek 的 Anthropic 兼容端点访问 - 这意味着现有的 Claude SDK 代码可以通过最小的更改来切换后端。
定价:商品价格的前沿视野
该实验模型继承了 V4-Flash 激进的价格表。输入令牌在非高峰时段的成本为每百万美元 0.22 美元,在高峰时段的缓存未命中成本为 0.44 美元,在非高峰时段的缓存命中成本降至每百万美元 0.007 美元。输出代币非高峰时段的价格为每百万美元 0.66 美元,高峰时段为每百万美元 1.32 美元。图片根据尺寸转换为token,并与文本token一起计费。
这种定价很重要,因为它极大地削弱了美国主要提供商的同类多式联运产品,从而延续了 DeepSeek 全年的价格战。该模型还继承了该系列的主要规格:100万个令牌上下文窗口、最多384K个令牌的最大输出、支持思考和非思考模式、JSON输出、工具调用以及2,500个并发限制——这些规格将其定位为大批量生产工作负载的真正主力,而不是研究玩具。
为什么开发者迫切需要这个
该发布发布在 Hacker News 上,很快就获得了超过 450 个点,而这种热情有一个特定的起源故事。 DeepSeek 的纯文本 V4-Flash-0731 因“相信”它能看到而享有盛誉。多名开发人员报告说,该模型会假设它具有视觉功能,然后在发现它不具备视觉功能时即兴制定复杂的解决方法,包括发明基于文本的图像分析工具,以及在意识到无法查看它们之前从连接的设备上提取屏幕截图。
一位评论者写道:“我听说 DeepSeek v4 Flash 0731 经常假设它具有视觉功能,然后当它发现它实际上看不到时,就会求助于发明基于文本的图像分析工具。”这与其他几位评论者的报道相呼应。对于任何使用该模型作为编码或自动化管道中的代理的人来说,新的视觉变体应该消除整个类别的混乱驱动的故障。
800x800 的捕获
此次发布并非没有限制,Hacker News 最尖锐的批评针对一个数字:图像分辨率。文档指出,在推理之前,每个图像都会自动调整大小,使其总像素数大致与 800x800 图像匹配,同时保留纵横比。
“这很有用,但对于 OCR 和许多其他应用程序来说,它需要更高一点(例如:放入完整的 A4/Letter 大小的页面),”一位开发人员争论道,另一位开发人员则直言不讳地回答说 800x800 的上限“扼杀了很多用例”。对于密集的文档、全页扫描或细粒度的 UI 调试,分辨率上限可能会促使开发人员转向更高分辨率且更昂贵的替代方案。该线程中建议了一种流行的解决方法:将大页面拆分为图块并分别提供它们。
另一个悬而未决的问题是开放性。 DeepSeek 因发布开放权重而享有盛誉,但该公司尚未透露是否会推出视觉版本。评论者猜测这可能源自该公司最近的“用视觉基元思考”研究,据报道该研究承诺了权重,但尚未得到证实。值得注意的是,该模型被列为实验性模型(“-exp”后缀),表明 DeepSeek 预计将进行迭代。
安静但具有战略意义的发布
视觉下降继续为位于杭州的实验室带来忙碌,该实验室在 8 月份发布了稳定的更新:V4-Flash-0731、面向代理的 DeepSeek Harness 框架、V4-Pro-0813 更新以及现在的多模式输入。 DeepSeek 并不是一次轰动一时的发布,而是执行快速、增量发布的节奏,将其模型保留在开发人员工具链中——这与西方实验室在编码代理上追求的抢地策略相同。
对于整个人工智能行业来说,这个信息很熟悉,但仍然让现有企业感到不舒服:曾经证明溢价合理的功能——在百万代币背景下的图像理解——现在却达到了每百万代币几美分。实验标签为 DeepSeek 提供了完善模型的空间,但开发人员已经开始将其连接到屏幕截图驱动的工作流程中。问题不再是 DeepSeek 能否在多模式功能集上与竞争对手相媲美,而是市场其他公司调整其价格的速度有多快。
保持人工智能领先地位
如需最新的 AI 模型发布、基准对比和行业分析,请添加书签 AI Buzz Wire。
阅读更多人工智能新闻 →