news 2026/8/3 16:46:43

DeepSeek 也能看图了?我们给企业 AI 中台的 Flash 0731 装上了一双“眼睛”

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek 也能看图了?我们给企业 AI 中台的 Flash 0731 装上了一双“眼睛”

很多人第一次把图片发给 DeepSeek 时,都会遇到类似的情况:图片明明已经上传,模型却无法直接理解画面,只能提示“解析失败”,或者把请求转交给单独的识图能力。

原因并不复杂:我们日常调用的 DeepSeek 主聊天模型,本质上仍以文本输入和文本推理为主。它擅长分析、归纳、写作和复杂推理,但图片里的物体、场景、表格与文字,并不会自动变成它能理解的上下文。

图 1:主聊天模型无法直接解析图片,需要额外的视觉识别链路。

在我们自建的企业 AI 中台里,我们没有简单地把文本模型替换掉,而是为当前接入的 DeepSeek Flash 0731 增加了一条“视觉前置链路”:先由 OCR 与通用视觉模型读取图片,再把识别结果组织成结构化上下文,交给 DeepSeek 完成后续推理。

最终效果是:员工仍然使用熟悉的 DeepSeek 对话入口,却可以直接上传截图、照片、扫描件和文档页面,让系统完成识别、理解和分析。

先把事实说清楚:这不是把文本模型硬改成视觉模型

根据 DeepSeek 官方 Chat Completions 文档,主聊天接口中的用户消息内容仍以文本结构为主。因此,把图片直接按多模态消息格式发送给不支持该格式的模型,通常会出现参数反序列化失败、未知image_url类型,或者模型完全看不到图片内容。

DeepSeek 也开源过独立的视觉语言模型系列,例如 DeepSeek-VL2。它与主聊天文本模型属于不同的模型家族和部署链路,并不意味着所有 DeepSeek API 模型天然都具备图像输入能力。

我们这次实现的准确描述是:

保留 DeepSeek Flash 0731 的文本推理能力,通过企业 AI 中台增加 OCR、视觉理解、上下文编排与失败降级,让它获得“系统级多模态”体验。

换句话说,不是给基础模型重新训练出一双眼睛,而是让中台先“看懂”,再让 DeepSeek 负责“想明白、讲清楚”。

整体架构:视觉模型负责看,DeepSeek 负责想

这条链路可以概括为:

图片 / 截图 / 扫描件 / PDF 页面 ↓ 文件校验与图像预处理 ↓ OCR + 通用视觉模型 ↓ 结构化视觉上下文与置信度 ↓ DeepSeek Flash 0731 ↓ 中文回答 / 表格 / 报告 / Agent 动作

图 2:视觉模型先完成图片内容识别,再把结构化结果交给 DeepSeek 分析。

这套设计中有一个非常重要的细节:OCR 不等于视觉理解。

OCR 擅长读取发票、合同、截图、表格和扫描件中的文字;但面对“一只狗正在吃西瓜”这样的自然图片,单靠 OCR 只能得到“未提取到文字”。所以我们把 OCR 和通用视觉模型组合起来:

  • 有文字的图片,优先提取原文、坐标、表格和版面结构;
  • 没有文字的图片,识别主体、场景、动作、颜色和空间关系;
  • 混合内容,合并 OCR 结果与视觉描述,并保留来源与置信度;
  • 识别失败时,不把空结果伪装成成功,而是提示用户切换模型或重新上传。

核心实现步骤

1. 输入路由:先判断请求里有没有视觉内容

中台收到消息后,先检查附件类型。纯文本请求直接交给 DeepSeek;图片、截图或 PDF 页面则进入视觉解析流程。这样不会让普通对话承担额外的视觉推理成本。

2. 文件安全与预处理

企业场景不能把“能上传”当作“可直接处理”。进入模型前,我们会执行:

  • 文件类型、大小与扩展名校验;
  • 图片解码与异常文件拦截;
  • 超大图片缩放、方向纠正与必要的清晰度增强;
  • PDF 页面转换与页码关联;
  • 临时文件隔离、访问控制与生命周期清理。

3. OCR 与视觉模型协同识别

对办公文档,OCR 输出文本、段落、表格和位置关系;对自然图片,视觉模型输出主体、动作、环境与关键细节。中台把两路结果合并成稳定的数据结构,而不是把一大段未经整理的描述直接塞给大模型。

示意结构如下:

{"summary":"一只白色小型犬在草地野餐垫上抱着西瓜","objects":["白色小型犬","西瓜","野餐垫","草地"],"actions":["双爪托住西瓜","张嘴进食"],"ocr_text":[],"confidence":0.94,"source":"vision-service"}

4. 给 DeepSeek 构造可追溯的上下文

视觉结果会和用户原始问题一起,组成一段明确的系统上下文。DeepSeek 负责基于这些已识别的信息完成解释、比较、总结、表格整理或后续 Agent 决策。

简化后的伪代码如下:

defhandle_message(user_text:str,images:list[bytes]):ifnotimages:returndeepseek.chat(user_text)visual_context=vision_service.analyze(images)prompt=f""" 你是企业 AI 助手。请仅依据下面的视觉识别结果和用户问题回答; 不确定的信息必须明确说明,不得凭空补全。 视觉识别结果:{visual_context}用户问题:{user_text}"""returndeepseek.chat(prompt)

5. 失败降级与可观测性

视觉服务超时、图片损坏或模型不可用时,中台不会继续向 DeepSeek 发送一个空的“识别成功”结果,而是进入明确的降级流程:

  • 重试可恢复的网络错误;
  • 切换备用 OCR 或视觉模型;
  • 对用户给出中文错误提示与下一步建议;
  • 记录请求链路、耗时和错误类型,但不在日志中保存敏感原图;
  • 保留模型调用与结果来源,便于企业审计。

为什么不直接把所有请求都交给一个大多模态模型?

在企业中台里,模型能力不是越“大而全”越好,关键是可控、可替换和可审计。

采用“视觉识别 + DeepSeek 推理”的组合,有几个现实优势:

  1. 保留强文本推理能力:复杂总结、结构化输出和业务分析继续由熟悉的 DeepSeek 完成。
  2. 能力解耦:OCR、通用视觉和文本模型可以独立升级,不必绑定单一厂商。
  3. 成本可控:纯文本请求不触发视觉模型,只有包含图片的消息才走视觉链路。
  4. 便于治理:企业可以分别控制文件权限、视觉模型、文本模型和审计日志。
  5. 失败可降级:某个视觉服务异常时,可以替换后端,而不是让整个聊天入口不可用。

实际体验:员工仍然只需要一个对话框

对最终用户而言,复杂的路由与模型协作都藏在中台后面。员工只需要上传图片并提出问题,例如:

  • “请描述这张现场照片里的异常情况”;
  • “识别这张表格截图并整理成 Markdown”;
  • “读取合同扫描页,提取甲乙方与关键日期”;
  • “分析设备告警截图,给出排障建议”;
  • “把白板照片整理成会议纪要和待办事项”。

图 3:用户仍然在统一的企业 AI 对话入口中使用 DeepSeek,视觉能力由中台自动编排。

仍然需要明确的能力边界

这套方案带来的是系统级多模态能力,但不能因此忽略边界:

  • 视觉模型可能识别错误,关键业务字段需要人工复核;
  • OCR 对模糊、倾斜、手写或复杂表格的准确率会下降;
  • 图片中的文字同样可能包含提示注入,不能直接获得系统指令权限;
  • 视频不是“多传几张图片”,还需要抽帧、时序理解与语音转写;
  • 涉及合同、身份信息和内部截图时,必须遵守企业数据权限和留存策略;
  • 模型输出只能作为辅助结论,不能替代法务、财务、安全等专业审核。

企业 AI 中台的价值,不是把越来越多模型堆进一个下拉框,而是让不同模型在正确的位置协作。

DeepSeek Flash 0731 继续发挥它擅长的文本推理,OCR 和视觉模型补上“看见”的能力,中台则负责路由、编排、权限、审计与降级。这样,我们不需要等待某一个模型原生包办所有事情,也能让企业员工获得自然、统一、可治理的多模态体验。

模型未必原生全能,但中台可以让能力真正组合起来。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/3 16:43:42

3分钟搞定!Blender 3MF插件:3D打印工作流的完美解决方案

3分钟搞定!Blender 3MF插件:3D打印工作流的完美解决方案 【免费下载链接】Blender3mfFormat Blender add-on to import/export 3MF files 项目地址: https://gitcode.com/gh_mirrors/bl/Blender3mfFormat 还在为Blender无法直接处理3D打印标准格式…

作者头像 李华
网站建设 2026/8/3 16:40:34

从电竞第一视角到复盘分析:拆解比赛细节的四个观察层

1. 从“爆了”到“复盘”:如何从一场比赛的“第一视角”里提取有效信息看到“爆了”、“第一视角”、“满脸不甘心”、“眼里没光了”这些词,很多观众的第一反应是点开视频,感受一下现场的情绪冲击。这确实是电子竞技最吸引人的部分之一——选…

作者头像 李华
网站建设 2026/8/3 16:39:39

网安新人最稳进阶顺序:先学什么、后学什么?彻底告别瞎学乱练

一、前言:90%新人的通病就是学习顺序颠倒绝大多数新人学网安的顺序完全错误:先学工具、先复现漏洞、先玩内网、先追新漏洞,最后基础一塌糊涂。导致学了半年,依旧看不懂流量、不会排查报错、无法独立实战。网安是强依赖基础、强逻辑…

作者头像 李华
网站建设 2026/8/3 16:36:39

NS-USBLoader完整指南:跨平台Switch游戏管理的终极解决方案

NS-USBLoader完整指南:跨平台Switch游戏管理的终极解决方案 【免费下载链接】ns-usbloader Awoo Installer and GoldLeaf uploader of the NSPs (and other files), RCM payload injector, application for split/merge files. 项目地址: https://gitcode.com/gh_…

作者头像 李华