Codex 接入视觉功能教程(2026)|vision-skill 外挂通义千问 qwen3-vl-flash 图文
在上一篇 Codex 接入 DeepSeek-V4-Flash 里,我们给 Codex 换上了 DeepSeek-V4-Flash 当底层模型。速度快、Agent 能力也强,但有一个短板:DeepSeek-V4-Flash 不是多模态模型,看不了图。
编程场景里看图其实挺刚需——UI 截图、报错信息、页面布局,光靠文字描述又慢又容易错。
目录:
- 为什么 Codex 需要外挂眼睛
- 原理:vision-skill 加 qwen3-vl-flash
- 接入前准备
- 第 1 步:在百炼控制台创建 API Key
- 第 2 步:把仓库和 API Key 交给 Codex 自动配置
- 第 3 步:验证识图
- 常见问题
为什么 Codex 需要外挂眼睛
接上 DeepSeek-V4-Flash 之后,Codex 的底层模型就成了纯文本模型:能读代码、改代码,但处理不了图片。这在纯写代码的场景没问题,一旦要对着截图干活——看 UI 还原界面、读报错弹窗、核对设计稿——就卡住了。
思路有点像工地分工:Flash 当工头,负责推理和改代码;旁边再雇一个专职看图的人,把画面翻译成文字交回去。主模型负责想,视觉模型负责看。

原理:vision-skill 加 qwen3-vl-flash
好在有大神提交了现成方案:vision-skill,给 Codex 加上眼睛。
- vision-skill:一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」——读本地或网络图片,调用视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill。
- 视觉模型:负责真正看图的那个。我选的是通义千问的 qwen3-vl-flash——专门看图的 VL 模型,日常读 UI / 截图够用,而且便宜。
qwen3-vl-flash 官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;并且新用户有一定的免费额度。
接入前准备
- ☐ 已完成上一篇教程:Codex 接入 DeepSeek-V4-Flash。没接也不影响本教程,但配置环境一致,演示更顺
- ☐ 一个阿里云百炼账号:没有就先注册
- ☐ 一个 API Key:在百炼控制台创建(下一步演示)
第 1 步:在百炼控制台创建 API Key


登录阿里云百炼控制台,进 API-KEY 管理,创建一个密钥并复制。这个 Key 等下有用。
安全提醒:这是你自己的钱袋子。API Key 只在你自己机器上用,别写进公开教程、别提交到公开仓库——被人拿去就会烧你的额度。
第 2 步:把仓库和 API Key 交给 Codex 自动配置

不用自己下载、不用手改配置,直接在 Codex 里粘贴下面这段,让它按 README 自己来:
帮我全局安装 asuojun/claude-vision-skill(https://github.com/asuojun/claude-vision-skill),
按照 README 的说明进行配置。
视觉模型选择阿里云百炼的 qwen3-vl-flash,
API Key 是 sk-你的APIKey(换成你刚创建的那一个)。注意:
sk-你的APIKey要替换成你自己在百炼创建的 Key,别照抄示例。
Codex 会自己下载仓库、检查环境、写入配置,全程不用你动手敲命令。
第 3 步:验证识图

配置搞定后,贴上一张截图让 Codex 识别。它能正确说出图片里是什么,就说明「眼睛」已经装上、识图生效了。
如果验证不通过,先回第 1 步确认 API Key 有没有填错,再让 Codex 检查一遍 vision-skill 的配置。
优缺点
给 Codex 加视觉这套方案的优点
- 便宜:qwen3-vl-flash 按 token 计费,输入 0.15 元/百万、输出 1.5 元/百万,新用户还有免费额度
- 省事:把仓库和 API Key 丢给 Codex,让它自己下载安装配置,不用手改文件
- 可替换:vision-skill 走 OpenAI 兼容格式,想换任何支持视觉的模型都行
不足 / 注意事项
- 依赖外挂:主模型本身仍不能看图,每次识图都要走一次视觉 API
- 需要阿里云百炼账号:要先注册并创建 API Key,Key 泄露或被公开会烧你的额度
- 有前置条件:最好先完成 DeepSeek-V4-Flash 接入教程,环境一致演示更顺
适合人群
- 用 Codex + DeepSeek-V4-Flash、但对截图 / UI 还原有需求的开发者
- 需要让 AI 读报错弹窗、核对页面布局、识别图片内容的前端与测试同学
- 想低成本给编程代理补上视觉能力的个人用户
常见问题
Q:DeepSeek-V4-Flash 不能看图吗? A:对。它是纯文本模型、不是多模态模型,本身没有识图能力,需要外挂一个视觉模型来补上。
Q:给 Codex 加视觉要额外花钱吗? A:视觉模型按 token 计费,不是按张收费。以 qwen3-vl-flash 为例,输入 0.15 元 / 百万 tokens、输出 1.5 元 / 百万 tokens;新用户还有一定免费额度,日常看图成本很低。
Q:vision-skill 是什么? A:一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」——读本地或网络图片,调用视觉 API,把描述塞回对话。仓库在 github.com/asuojun/claude-vision-skill。
Q:必须用 qwen3-vl-flash 吗? A:不一定。vision-skill 走 OpenAI 兼容格式,任何支持视觉的模型都能换。本文以 qwen3-vl-flash 为例,是因为它便宜、新用户有免费额度,日常读 UI 和截图够用。
Q:怎么确认 Codex 识图生效了? A:配置后直接贴一张截图让 Codex 识别,它能正确描述图片内容就说明生效了。
需要开通 Codex?查看 Codex 充值专题页,了解支持套餐、支付方式和到账流程。
