大家好,我是晓凡。
一、DeepSeek 便宜好用,偏偏“看不见”
用DeepSeek的人是越来越多了。理由也简单,便宜,还越来越强。
V4-Flash正式版一出来,性能又往上蹿了一截,就在前几天 V4-Pro 正式版也发布了。
有平台披露,DeepSeekToken 消耗已经冲到 8 万亿,说明大家是真金白银在用,不是嘴上说说。
不过用久了的人,多半都撞上过同一个坎:它看不了图。
你发张截图过去,它是懵的,直接告诉你“我无法处理图片”。这对聊天来说没多大影响,但一到正经干活的时候,就有点难受了。
举个最常见的例子。代码报错了,你想让它帮你看看,截图发过去,它读不了。你只能把报错信息一个字一个字复制粘贴成文字,还得描述清楚是哪个文件、哪一行。碰到那种排版乱糟糟的报错堆栈,复制粘贴能把自己绕晕。
再比如做前端,设计稿摆在眼前,你想让它照着写界面。它看不见图,你只能靠嘴描述:左边一个按钮,右边一个输入框,颜色是蓝的……费半天劲,描述出来还感觉跟自己脑子里想的不一样。
这些场景,说到底就是它没有“眼睛”,不是多模态模型。
其实不止DeepSeek,很多主打文本的大模型都有这个短板。只是DeepSeek用的人多、价格又便宜,大家特别愿意拿它来干活,这个缺陷就被放大了。
好在,这块短板现在有现成的办法能补上,成本低到可以忽略,下面细说。
二、一个开源 Skill 把事解决了
这个能力不用等官方更新,开源社区早有人把方案做好了,名字叫claude-vision-skill。
别被“Claude”这名字劝退了。它虽然是给 Claude 做的,但能装到任何 Agent 上,装好之后 Agent 会自己去适配。
这 Skill 目前 star 也到了1.9k。
GitHub 地址:https://github.com/asuojun/claude-vision-skill
它背后的原理挺简单:先把图片发给一个会识图的模型,让这个模型用文字把图里的内容描述出来,再把这段文字喂回给 DeepSeek。DeepSeek 拿到的是文字,自然就“看懂”了。
说白了,就是请一个"看得见"的模型当翻译,把图片翻成文字,再转述给 DeepSeek。它自己不用会看图,只需要会读翻译结果就行。
所以你得额外配一个会识图的模型。
仓库默认推荐阿里千问的qwen3.5-omni-plus和qwen-vl-max。
为什么是千问?因为便宜。阿里云百炼给新用户送 100 万 Token 的免费额度,折算下来识一次图大概两分钱,跟不要钱差不多。
当然,你手上要是有别的支持 OpenAI 兼容接口的识图模型,一样能用,不挑。这个 Skill 干的其实就是个"搬运"的活儿,中间的识图模型换成谁都可以。
三、 安装
直接把下面内容丢给 Codex,剩下的它自己搞定,不用你手动敲命令、改配置。
按 https://github.com/asuojun/claude-vision-skill 的 README 帮我配置识图
整个过程它自己会去拉代码、写配置,你盯着看就行。
装完之后还剩最后一步:配识图模型的 API Key。
默认走阿里千问,需要到千问AI平台: https://platform.qianwenai.com/home/api-keys 去创建一个API Key。
新用户那 100 万免费额度,大概能识图 7000 次。
就算你天天用,也够顶好几个月。等免费额度用完了,继续充也不贵,一次两分钱,日常用基本不心疼。
有两个小地方值得留意。第一,第一次用它识图时,Agent 可能会弹一下,让你确认要调用外部模型,点个同意就行。
第二,API Key 别随便往外发,千问是按量计费的,虽然便宜,但被有心人拿去刷就亏了。
四、装上之后,效果如何
装完直接就能用,不用重启,不用再折腾一遍。
我随手拿一张图试了试,让它读图里的内容。
结果它对得挺好,文字、结构基本都识别出来了。
我又把一张Ruoyi项目启动报错的截图丢给它。
这么一搞,DeepSeek 就算"睁眼"了。以后写代码碰到报错,直接截图发过去;界面长什么样,一张图说明白。
我现在基本把它当默认配置用了。改前端的时候截图丢过去,它能把布局、配色、间距说得八九不离十,照着写省不少来回。
看文档截图、读报错、甚至翻译图片里的英文,都能顺手干。原来需要我把文字复制进去,现在一张图就搞定了。
至于识图模型本身的准确度,Qwen这套在中文场景下表现挺稳,日常截图、文档、界面基本够用。真要碰到特别复杂的图,偶尔也会翻车,不过那属于个别情况,不影响大局。
总结
给 DeepSeek 补上识图能力,成本几乎可以忽略,效果却立竿见影。原理不复杂,就是借一个会看的模型,把图片变成文字再转给它。
装起来也就一句话的事,前后几分钟。有需要的小伙伴,值得一试。