DeepSeek新版本测评:能认马斯克,却对梁文锋一无所知
经过漫长的等待,DeepSeek在经历了四个月的更新后,终于上线了其全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp。这次的更新引入了原生的图片输入功能,让模型能够直接识别人、分析截图和解读图表。尽管价格依旧保持了DeepSeek的一贯风格,一张图片最多转换为384个输入Token,即使在需求高峰期,也仅需花费一分钱,就能让它分析八张图片。而这一新功能无疑填补了DeepSeek在视觉理解上的空白,外界对其更新后的表现充满期待。
然而,网上的用户反馈却不尽如人意,许多人在使用后评价其“效果一般”。尽管其性能评分看上去令人满意,用户的实际体验却显得相对失望。某个知乎帖子中提到Vision-Exp的发布,获得了广泛讨论,甚至有用户戏谑地建议梁文锋别去看这些恶评。尽管有观点认为这款模型是“好模型”,但评价中“破碎也可以原谅”等词句显然并不是赞美的声音。
尽管官方数据显示Vision-Exp在许多指标上与V4-Flash相近,甚至在某些视觉理解的基准测试中与顶尖模型Anthropic的Opus 4.8不相上下,但其实际表现却让人堪忧。比如,当用户试图让它识别梁文锋的照片时,模型错误地将其认为是美团创始人王兴。而在另一个实验中,DeepSeek甚至把梁文锋认成了字节跳动的创始人张一鸣,这种错误的识别频繁出现,令人感到困惑。
进一步的实验中,将时代少年团的合照提交给模型,结果DeepSeek不仅没有识别出任何人名,反而声称照片可能是批量生成的虚假图像,甚至怀疑里面根本没有真实人物。这让人对DeepSeek的视力产生了疑问。
而当面临更复杂的任务时,Vision-Exp的问题依旧没有得到解决。用户要求其生成一个Three.js的三维场景,虽然最终结果有所改进,但在执行过程中模型不仅自我纠错频繁,还出现了多次断连。执行同一任务时,它的Token消耗高出15倍,耗时也多出3.5倍。这些表现表明,尽管该模型在理论评分中处于领先地位,其在实际操作中仍显得不够成熟。
由于线上测试很可能受到图片质量和提示词的影响,我们决定进行一次自主测试。为了考验Vision-Exp的识人能力,我们选择了一张AI合成的搞笑图,其中包含梁文锋、马斯克和奥尔特曼的形象,目的不仅仅是为了识别人物,更是考察模型理解图中内容的能力。
最终的结果显示,Vision-Exp确实成功识别出了梁文锋和马斯克,并描绘了他们的外貌特征。但在对复杂背景的理解和情境的把握上,模型的表现仍然需要进一步提升。