Codex 接入视觉功能教程(2026)|vision-skill 外挂通义千问 qwen3-vl-flash 图文
在上一篇 Codex 接入 DeepSeek-V4-Flash 里,我们给 Codex 换上了 DeepSeek-V4-Flash 当底层模型。速度快、Agent 能力也强,但有一个短板:DeepSeek-V4-Flash 不是多模态模型,看不了图。
编程场景里看图其实挺刚需——UI 截图、报错信息、页面布局,光靠文字描述又慢又容易错。
先看结论:给 Codex 加视觉就三步——① 在阿里云百炼控制台创建 API Key;② 把开源仓库 asuojun/claude-vision-skill 和 API Key 一起丢给 Codex,让它自己下载安装配置;③ 发一张图验证。视觉模型选通义千问 qwen3-vl-flash,便宜、新用户还有免费额度。全程约 5 分钟。
目录:
- 为什么 Codex 需要外挂眼睛
- 原理:vision-skill 加 qwen3-vl-flash
- 接入前准备
- 第 1 步:在百炼控制台创建 API Key
- 第 2 步:把仓库和 API Key 交给 Codex 自动配置
- 第 3 步:验证识图
- 常见问题
- 相关阅读
为什么 Codex 需要外挂眼睛
接上 DeepSeek-V4-Flash 之后,Codex 的底层模型就成了纯文本模型:能读代码、改代码,但处理不了图片。这在纯写代码的场景没问题,一旦要对着截图干活——看 UI 还原界面、读报错弹窗、核对设计稿——就卡住了。
思路有点像工地分工:Flash 当工头,负责推理和改代码;旁边再雇一个专职看图的人,把画面翻译成文字交回去。主模型负责想,视觉模型负责看。

原理:vision-skill 加 qwen3-vl-flash
好在有大神提交了现成方案:vision-skill,给 Codex 加上眼睛。
- vision-skill:一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」——读本地或网络图片,调用视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill。
- 视觉模型:负责真正看图的那个。我选的是通义千问的 qwen3-vl-flash——专门看图的 VL 模型,日常读 UI / 截图够用,而且便宜。
qwen3-vl-flash 官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;并且新用户有一定的免费额度。
接入前准备
- ☐ 已完成上一篇教程:Codex 接入 DeepSeek-V4-Flash。没接也不影响本教程,但配置环境一致,演示更顺
- ☐ 一个阿里云百炼账号:没有就先注册
- ☐ 一个 API Key:在百炼控制台创建(下一步演示)
第 1 步:在百炼控制台创建 API Key


登录阿里云百炼控制台,进 API-KEY 管理,创建一个密钥并复制。这个 Key 等下有用。
安全提醒:这是你自己的钱袋子。API Key 只在你自己机器上用,别写进公开教程、别提交到公开仓库——被人拿去就会烧你的额度。
第 2 步:把仓库和 API Key 交给 Codex 自动配置

不用自己下载、不用手改配置,直接在 Codex 里粘贴下面这段,让它按 README 自己来:
帮我全局安装 asuojun/claude-vision-skill(https://github.com/asuojun/claude-vision-skill),
按照 README 的说明进行配置。
视觉模型选择阿里云百炼的 qwen3-vl-flash,
API Key 是 sk-你的APIKey(换成你刚创建的那一个)。注意:
sk-你的APIKey要替换成你自己在百炼创建的 Key,别照抄示例。
Codex 会自己下载仓库、检查环境、写入配置,全程不用你动手敲命令。
第 3 步:验证识图

配置搞定后,贴上一张截图让 Codex 识别。它能正确说出图片里是什么,就说明「眼睛」已经装上、识图生效了。
如果验证不通过,先回第 1 步确认 API Key 有没有填错,再让 Codex 检查一遍 vision-skill 的配置。
常见问题
Q:DeepSeek-V4-Flash 不能看图吗? A:对。它是纯文本模型、不是多模态模型,本身没有识图能力,需要外挂一个视觉模型来补上。
Q:给 Codex 加视觉要额外花钱吗? A:视觉模型按 token 计费,不是按张收费。以 qwen3-vl-flash 为例,输入 0.15 元 / 百万 tokens、输出 1.5 元 / 百万 tokens;新用户还有一定免费额度,日常看图成本很低。
Q:vision-skill 是什么? A:一个开源技能包,给没有原生识图能力的主模型外挂「眼睛」——读本地或网络图片,调用视觉 API,把描述塞回对话。仓库在 github.com/asuojun/claude-vision-skill。
Q:必须用 qwen3-vl-flash 吗? A:不一定。vision-skill 走 OpenAI 兼容格式,任何支持视觉的模型都能换。本文以 qwen3-vl-flash 为例,是因为它便宜、新用户有免费额度,日常读 UI 和截图够用。
Q:怎么确认 Codex 识图生效了? A:配置后直接贴一张截图让 Codex 识别,它能正确描述图片内容就说明生效了。
相关阅读
- Codex 接入 DeepSeek-V4-Flash — 上一篇:给 Codex 换上 DeepSeek-V4-Flash
- Codex App 使用教程 — 新用户从下载安装到上手
- Codex 额度哪家强? — 四种套餐 Codex 额度完整对比
- ChatGPT 使用教程 — 全部 ChatGPT 教程索引
