当前位置: 首页 > news >正文

DeepSeek 也能看图了?我们给企业 AI 中台的 Flash 0731 装上了一双“眼睛”

很多人第一次把图片发给 DeepSeek 时,都会遇到类似的情况:图片明明已经上传,模型却无法直接理解画面,只能提示“解析失败”,或者把请求转交给单独的识图能力。

原因并不复杂:我们日常调用的 DeepSeek 主聊天模型,本质上仍以文本输入和文本推理为主。它擅长分析、归纳、写作和复杂推理,但图片里的物体、场景、表格与文字,并不会自动变成它能理解的上下文。

图 1:主聊天模型无法直接解析图片,需要额外的视觉识别链路。

在我们自建的企业 AI 中台里,我们没有简单地把文本模型替换掉,而是为当前接入的 DeepSeek Flash 0731 增加了一条“视觉前置链路”:先由 OCR 与通用视觉模型读取图片,再把识别结果组织成结构化上下文,交给 DeepSeek 完成后续推理。

最终效果是:员工仍然使用熟悉的 DeepSeek 对话入口,却可以直接上传截图、照片、扫描件和文档页面,让系统完成识别、理解和分析。

先把事实说清楚:这不是把文本模型硬改成视觉模型

根据 DeepSeek 官方 Chat Completions 文档,主聊天接口中的用户消息内容仍以文本结构为主。因此,把图片直接按多模态消息格式发送给不支持该格式的模型,通常会出现参数反序列化失败、未知image_url类型,或者模型完全看不到图片内容。

DeepSeek 也开源过独立的视觉语言模型系列,例如 DeepSeek-VL2。它与主聊天文本模型属于不同的模型家族和部署链路,并不意味着所有 DeepSeek API 模型天然都具备图像输入能力。

我们这次实现的准确描述是:

保留 DeepSeek Flash 0731 的文本推理能力,通过企业 AI 中台增加 OCR、视觉理解、上下文编排与失败降级,让它获得“系统级多模态”体验。

换句话说,不是给基础模型重新训练出一双眼睛,而是让中台先“看懂”,再让 DeepSeek 负责“想明白、讲清楚”。

整体架构:视觉模型负责看,DeepSeek 负责想

这条链路可以概括为:

图片 / 截图 / 扫描件 / PDF 页面 ↓ 文件校验与图像预处理 ↓ OCR + 通用视觉模型 ↓ 结构化视觉上下文与置信度 ↓ DeepSeek Flash 0731 ↓ 中文回答 / 表格 / 报告 / Agent 动作

图 2:视觉模型先完成图片内容识别,再把结构化结果交给 DeepSeek 分析。

这套设计中有一个非常重要的细节:OCR 不等于视觉理解。

OCR 擅长读取发票、合同、截图、表格和扫描件中的文字;但面对“一只狗正在吃西瓜”这样的自然图片,单靠 OCR 只能得到“未提取到文字”。所以我们把 OCR 和通用视觉模型组合起来:

  • 有文字的图片,优先提取原文、坐标、表格和版面结构;
  • 没有文字的图片,识别主体、场景、动作、颜色和空间关系;
  • 混合内容,合并 OCR 结果与视觉描述,并保留来源与置信度;
  • 识别失败时,不把空结果伪装成成功,而是提示用户切换模型或重新上传。

核心实现步骤

1. 输入路由:先判断请求里有没有视觉内容

中台收到消息后,先检查附件类型。纯文本请求直接交给 DeepSeek;图片、截图或 PDF 页面则进入视觉解析流程。这样不会让普通对话承担额外的视觉推理成本。

2. 文件安全与预处理

企业场景不能把“能上传”当作“可直接处理”。进入模型前,我们会执行:

  • 文件类型、大小与扩展名校验;
  • 图片解码与异常文件拦截;
  • 超大图片缩放、方向纠正与必要的清晰度增强;
  • PDF 页面转换与页码关联;
  • 临时文件隔离、访问控制与生命周期清理。

3. OCR 与视觉模型协同识别

对办公文档,OCR 输出文本、段落、表格和位置关系;对自然图片,视觉模型输出主体、动作、环境与关键细节。中台把两路结果合并成稳定的数据结构,而不是把一大段未经整理的描述直接塞给大模型。

示意结构如下:

{"summary":"一只白色小型犬在草地野餐垫上抱着西瓜","objects":["白色小型犬","西瓜","野餐垫","草地"],"actions":["双爪托住西瓜","张嘴进食"],"ocr_text":[],"confidence":0.94,"source":"vision-service"}

4. 给 DeepSeek 构造可追溯的上下文

视觉结果会和用户原始问题一起,组成一段明确的系统上下文。DeepSeek 负责基于这些已识别的信息完成解释、比较、总结、表格整理或后续 Agent 决策。

简化后的伪代码如下:

defhandle_message(user_text:str,images:list[bytes]):ifnotimages:returndeepseek.chat(user_text)visual_context=vision_service.analyze(images)prompt=f""" 你是企业 AI 助手。请仅依据下面的视觉识别结果和用户问题回答; 不确定的信息必须明确说明,不得凭空补全。 视觉识别结果:{visual_context}用户问题:{user_text}"""returndeepseek.chat(prompt)

5. 失败降级与可观测性

视觉服务超时、图片损坏或模型不可用时,中台不会继续向 DeepSeek 发送一个空的“识别成功”结果,而是进入明确的降级流程:

  • 重试可恢复的网络错误;
  • 切换备用 OCR 或视觉模型;
  • 对用户给出中文错误提示与下一步建议;
  • 记录请求链路、耗时和错误类型,但不在日志中保存敏感原图;
  • 保留模型调用与结果来源,便于企业审计。

为什么不直接把所有请求都交给一个大多模态模型?

在企业中台里,模型能力不是越“大而全”越好,关键是可控、可替换和可审计。

采用“视觉识别 + DeepSeek 推理”的组合,有几个现实优势:

  1. 保留强文本推理能力:复杂总结、结构化输出和业务分析继续由熟悉的 DeepSeek 完成。
  2. 能力解耦:OCR、通用视觉和文本模型可以独立升级,不必绑定单一厂商。
  3. 成本可控:纯文本请求不触发视觉模型,只有包含图片的消息才走视觉链路。
  4. 便于治理:企业可以分别控制文件权限、视觉模型、文本模型和审计日志。
  5. 失败可降级:某个视觉服务异常时,可以替换后端,而不是让整个聊天入口不可用。

实际体验:员工仍然只需要一个对话框

对最终用户而言,复杂的路由与模型协作都藏在中台后面。员工只需要上传图片并提出问题,例如:

  • “请描述这张现场照片里的异常情况”;
  • “识别这张表格截图并整理成 Markdown”;
  • “读取合同扫描页,提取甲乙方与关键日期”;
  • “分析设备告警截图,给出排障建议”;
  • “把白板照片整理成会议纪要和待办事项”。

图 3:用户仍然在统一的企业 AI 对话入口中使用 DeepSeek,视觉能力由中台自动编排。

仍然需要明确的能力边界

这套方案带来的是系统级多模态能力,但不能因此忽略边界:

  • 视觉模型可能识别错误,关键业务字段需要人工复核;
  • OCR 对模糊、倾斜、手写或复杂表格的准确率会下降;
  • 图片中的文字同样可能包含提示注入,不能直接获得系统指令权限;
  • 视频不是“多传几张图片”,还需要抽帧、时序理解与语音转写;
  • 涉及合同、身份信息和内部截图时,必须遵守企业数据权限和留存策略;
  • 模型输出只能作为辅助结论,不能替代法务、财务、安全等专业审核。

企业 AI 中台的价值,不是把越来越多模型堆进一个下拉框,而是让不同模型在正确的位置协作。

DeepSeek Flash 0731 继续发挥它擅长的文本推理,OCR 和视觉模型补上“看见”的能力,中台则负责路由、编排、权限、审计与降级。这样,我们不需要等待某一个模型原生包办所有事情,也能让企业员工获得自然、统一、可治理的多模态体验。

模型未必原生全能,但中台可以让能力真正组合起来。

http://www.jsqmd.com/news/1321102/

相关文章:

  • 卫星图→手机端→农机决策:一套端到端AI识别系统如何72小时内让合作社增产11.3%?
  • 电脑商城推荐适合家居建材行业的:2026家居建材商家选型指南
  • NeRF神经辐射场:从原理到实践,手把手实现三维场景重建
  • 终极Wand-Enhancer解锁指南:从每日2小时限制到永久免费的完整解决方案
  • 拼多多推广有哪些费用?2026最全收费标准
  • 上海企业破产债务重组律师:困境企业拯救与重整专业法律服务 - 品牌深度评测
  • 用AI淘汰普通人,是资本干过最蠢的事
  • Windows DLL注入终极指南:用Xenos轻松掌控进程控制
  • 网盘直链下载助手终极指南:告别限速,轻松获取八大网盘真实下载链接
  • 警惕报价猫腻!贵阳黄金回收低价铺垫、后期砍价套路,一招识破 - 奢侈品回收评测
  • 21 节课程助你开启生成式 AI 应用开发之旅,还有多种运行方式和资源可选!
  • 邢昊|企优托一网推江苏全域负责人,AIGEO 领域首选专家,助力企业抢占 AI 知识图谱流量高地--企优托集团
  • 如何快速掌握游戏修改:Forza Mods AIO 5大实战技巧深度解析
  • VideoDownloadHelper终极指南:3分钟学会免费下载网页视频的简单方法
  • 【扣子×飞书机器人实战指南】:0代码接入、3步上线、7天提升50%团队响应效率
  • uni-app页面返回监听与数据更新:onBackPress()跨端解决方案
  • 2026年8月武汉比较专业的保险纠纷维权律师推荐诗慧律师,深耕各类保险纠纷诉讼 - 专业优选推荐榜
  • SpringBoot+Flowable 审批候选人策略设计:十余种 Strategy + Invoker,一次讲清下一关谁审
  • 为什么92%的技术人学AI却三年内掉队?——解密认知带宽、学习ROI与神经可塑性三重瓶颈(附个人学习效能诊断表)
  • 大鼠原代下腔静脉平滑肌细胞:静脉回流的“动力调控者”
  • 一线观察:工业皮带厂家的长期使用真相 - 产品推荐官
  • 如何在100个Excel文件中1分钟找到你要的数据?这个免费工具太强了!
  • KMS_VL_ALL_AIO:一站式智能激活脚本的完整指南
  • 从贪心到神经网络:2048游戏AI助手的算法实现与优化
  • 终极Windows热键侦探:一键揪出快捷键冲突元凶
  • 40亿参数3D生成模型TRELLIS.2:高效多能,多平台资源与训练代码全公开!
  • 崩坏星穹铁道三月七小助手:5分钟学会解放双手的全自动游戏辅助
  • KVM存储虚拟化与LVM存储池配置实战
  • AI超节点Scale Up域总线各层优化设计
  • 郑州登报怎么办线上办理更省事 - luffy+2