[开源] 给不会看图的 AI 自动装上眼睛:DeepSeek/Kimi 发截图不再报错

各位好!分享一个我最近在做的小工具 Auto Vision Bridge,它能把任意不支持视觉的大模型变成"能看图"的模型。

痛点很简单:DeepSeek、Kimi、文心这些文本模型一发截图就报错或答非所问,每次都要手动把图片转成文字再喂回去,非常麻烦。这个项目就是夹在 AI 客户端和模型服务之间的一个轻量中转层(反向代理),自动完成识图。

GitHub 仓库:Auto Vision Bridge(求个 Star 鼓励一下!)

这是什么项目

Auto Vision Bridge 是零依赖的 Node.js 中转服务(Node ≥ 18,不需要 npm install):请求里有图片时,自动判断模型支不支持视觉——支持就原样透传,不支持就调用视觉模型识别成文字再转发,全程无需手动操作。

核心亮点

  • 智能判断:白名单 / 黑名单 / 启发式三档决策,未知模型默认按"不支持"处理,发图绝不报错
  • 零依赖:只用 Node.js 原生模块,clone 下来直接 node bridge/server.mjs 就能跑
  • 三种图片通道全覆盖:Chat API、Responses API、Markdown 图片
  • 同图缓存:同一张图不重复调用视觉 API(300 条 LRU),省钱又省时
  • Key 安全:视觉 API Key 只存在本地 config.json(已 gitignore),不进 git
  • 交互式配置向导:node scripts/setup.mjs 静默输入 Key、自动备份、可选验证
  • 附赠 MCP 模式:标准 MCP Server(analyze_image 工具),支持 7 家服务商 20+ 免费视觉模型

快速开始

git clone https://github.com/nhzhongguo/auto-vision-bridge
cd auto-vision-bridge
node scripts/setup.mjs   # 交互式配置 Key 和上游地址
node bridge/server.mjs   # 启动

然后把 AI 客户端的 base_url 改成 http://127.0.0.1:57399/v1 重启即可。Windows 也有隐藏窗口启动脚本。

适用场景

适合 DeepSeek / Kimi / 文心等文本模型 + 截图场景,也适合接 gpt-4o / Gemini / Claude 等视觉模型原样透传;不想让 AI 助手经手 API Key 的话,也可以自己跑配置向导。

项目状态

  • 开源协议:MIT
  • 当前状态:持续迭代中,欢迎 Issue / PR / 功能建议

如果觉得对你有帮助,欢迎去 GitHub 点个 Star;遇到问题可以直接在帖子里回复,或者去提 Issue/PR。

1 个赞

欢迎新成员加入我们的论坛,希望能够持续输出!

等等,你这里有报错啊……

PS C:\Users\akari> node bridge/test-bridge.mjs --image C:\Users\akari\OneDrive\图片\ENDFIELD\ENDFIELD_SHARE_1769304622.png
node:internal/modules/cjs/loader:1520
  throw err;
  ^

Error: Cannot find module 'C:\Users\akari\bridge\test-bridge.mjs'
    at Module._resolveFilename (node:internal/modules/cjs/loader:1517:15)
    at wrapResolveFilename (node:internal/modules/cjs/loader:1071:27)
    at defaultResolveImplForCJSLoading (node:internal/modules/cjs/loader:1095:10)
    at resolveForCJSWithHooks (node:internal/modules/cjs/loader:1122:12)
    at Module._load (node:internal/modules/cjs/loader:1294:5)
    at wrapModuleLoad (node:internal/modules/cjs/loader:255:19)
    at Module.executeUserEntryPoint [as runMain] (node:internal/modules/run_main:154:5)
    at node:internal/main/run_main_module:33:47 {
  code: 'MODULE_NOT_FOUND',
  requireStack: []
}

我看看怎么回事。。。。。。。。。。。。。。。。。

硅基流动视觉模型默认 Qwen/Qwen2.5-VL-7B-Instruct,,找到问题了,随便把默认配置目录也修了,要使用视觉理解模型Qwen/Qwen3.5-9B 是纯文本模型,不支持视觉。

在部署时,AI 还发现了 Bug……

怎么样了佬,现在能识别出图片了没有,还不行的话,我先把我电脑上的先卸掉,再重新部署我再看看:joy:

可以了,ChatGPT 可以调用视觉模型

你的软件效果太好了,我使用下来体验很好。