据媒体报道,DeepSeek V4家族的第一个多模态模型——DeepSeek-V4-Flash-Vision-Exp已经悄悄上线Hugging Face,而且直接用MIT License开!源!了!它的多模态Agent能力居然摸到了Opus-4.8的门槛!
这次公开的东西超全,不仅有模型文件、Tokenizer、prompt Encoding参考代码,连最小化的PyTorch推理实现都放出来了,视觉编码器、Aligner、DFlash Attention、MoE这些核心模块统统给你打包到位
根据媒体消息,这可是DeepSeek V4系列第一个原生支持图片输入的视觉模型哦!官方明明白白标了“Exp”也就是实验版本,早在2026年8月21日就已经登上DeepSeek API平台啦!
它可不只玩文字哦,现在直接能把图片当输入喂进去!描述图片内容、识别截图文字、分析表格数据这些活都能搞定,JPEG、PNG、GIF、WebP常用图片格式它全认!
深度求索官方发话啦:V4-Flash-Vision-Exp在各种Agent框架里都能完美适配,适配能力好得超出预期!大家完全可以靠它搭配各种Agent工具,解锁超多好用的新工作场景~
它在纯文本任务(比如Agent推理、世界知识类任务)上的表现,和V4-Flash正式版一模一样,原有的优势一点都没丢!而在需要视觉理解的Agent基准测试里,它的表现比原来的V4-Flash好了不止一点,现在多模态Agent能力都快追上Opus-4.8啦!
客服热线:










