踏入 AI 高阶之路:从聚合对话到智能体(Agent)

引言
欢迎阅读本指南。如果你平时使用 AI 还局限于“打开浏览器网站、进入豆包 App、打字聊天”的初级阶段,那么这篇指南将带你解锁 AI 的全新玩法。
一、写在前面
为了帮助大家更高效地把 AI 融入学习与科研,我们将介绍两种进阶使用 AI 的方案。它们将分别解决日常对话的效率瓶颈和复杂任务自动化的需求:
- Cherry Studio 是对话工具的集大成者,也是笔者从小白迈向高阶专业用法的“桥梁”。通过它,你可以把所有大模型(如 DeepSeek、千问、智谱等)整合进一个本地客户端中,实现多模型一键切换、专业级参数调节,以及助手与话题分离。告别混乱的网页端与 App,开启属于你的“专业对话工作台”。
- Agent(智能体) 是一类能够自主规划、调用工具、执行多步骤任务的 AI 系统。与你平时使用的“聊天 AI”不同,Agent 不只是回答问题,它还可以帮你写代码、读文件、搜索网页、自动完成复杂任务——更像一个会干活的助理,而不只是一个会说话的工具。
目前市面上较为成熟的 Agent 工具,如 OpenAI Codex 和 Anthropic Claude Code,均来自海外。但在国内使用其内置 AI 需要 VPN 翻墙——这是明确的违法行为,且有诸多不便和法律风险。本指南采用“国内大模型为大脑,国外 Agent 为身体”的方案,“中体西用”。我们将详细说明如何通过 API 将国内大模型接入 Codex 和 Claude 的生态中。
Q&A:读前必知
Q1:AI 界的全景图长什么样?
| 名称 | 可以理解为 | 能做什么 | 典型代表 |
|---|---|---|---|
| 大语言模型(LLM) | AI 的“大脑” | 对话、写作、翻译、解释知识、生成代码、逻辑推理等 | ChatGPT、Claude、DeepSeek |
| LLM 官方网页/App | AI 的“对话窗口” | 打开即用,进行对话、写作、翻译和答疑 | ChatGPT App、DeepSeek App、元宝 App、豆包 App |
| AI 桌面客户端 | AI 的“聚合管理台” | 在一个软件里统一管理和切换多个 AI | Cherry Studio、Chatbox |
| 编辑器/IDE 插件 | 写代码时的“隐形副手” | 边写代码边补全,实时读取当前文件并辅助修改 | GitHub Copilot、Cursor、通义灵码 |
| Agent(智能体) | “有手有脚”的 AI 打工仔 | 自主读文件、改代码、运行命令,完成多步骤复杂任务 | Claude Code、OpenAI Codex、WorkBuddy |
Q2:什么是 API Key,为什么要获取 API Key?
API Key 可以理解为访问 AI 模型服务的“通行证”。
当你使用 Cherry Studio、Codex 等 AI 工具时,这些工具本身并不包含 AI 模型。它们需要通过网络向 AI 平台“借用”模型能力来完成任务。API Key 就是这个过程中用来证明身份并计算使用费用的凭证。
打个比方:API Key 就像校园卡,Token(词元)就是里面的额度。食堂(AI 平台)认的是卡,而不是人脸。你的各种 AI 工具(Cherry Studio、Codex++ 等)刷你的卡去取餐(调用模型),消费的 Token 从你的账户中扣除。
Q3:这份指南要解决什么问题?
我们有强大的国产大模型(大脑),但官方网页版和 App 的功能较为单一,它们往往不是满血版本,而是能力受限的版本。API Key 面向专业用户,代表了平台的较高水准;配合合适的工具,能够“玩出花儿来”。这就是为什么我们还要折腾“客户端”和“Agent”:通过它们,我们能一窥顶尖 AI 的魅力。
二、获取 API Key
如果想体验满血的国内大模型作为“大脑”,你需要先获取一个 API Key,这样后续软件才能通过 API 调用模型并消耗 Token。
笔者推荐: 阿里云面向大学生提供一定额度支持,比较适合小白上手。
获取阿里云百炼 API Key
访问阿里云高校计划 (opens new window),完成学生认证并领取相应权益。大学生可获取一年 300 元学生额度,用于抵扣阿里云平台指定项目,其中包括阿里云百炼大模型平台。

打开阿里云百炼控制台 (opens new window),登录账号后点击 API Key。

在 API Key 页面点击创建按钮。

创建 API Key,并在创建时及时复制、妥善保存。

阿里云百炼兼容模式 API 地址为:
https://dashscope.aliyuncs.com/compatible-mode/v1
当你的学生认证已经完成并成功领券,在额度用尽前,全过程不需要额外充值。300 元抵用券的剩余额度可在阿里云费用与成本优惠券页面 (opens new window)查询。
其他主流 AI 大模型平台
DeepSeek
- 官网:DeepSeek (opens new window)
- 代表模型:
deepseek-v4-pro、deepseek-v4-flash

智谱 Z.ai
- 官网:智谱 Z.ai 开放平台 (opens new window)
- 代表模型:
glm-5.3

千问 Qwen
- 官网:千问开放平台 (opens new window)
- 代表模型:
qwen3.8-max

Kimi
- 官网:Kimi 开放平台 (opens new window)
- 代表模型:
Kimi K3

OpenAI ChatGPT(仅作了解,不推荐)
- 官网:OpenAI API 平台 (opens new window)
- 代表模型:
gpt-5.6

Anthropic Claude(仅作了解,不推荐)
- 官网:Claude 开发者平台 (opens new window)
- 代表模型:
Claude-Opus-5

xAI Grok(仅作了解,不推荐)
- 官网:xAI Console (opens new window)
- 代表模型:
Grok-4.5

Google Gemini(仅作了解,不推荐)
- 官网:Google AI Studio (opens new window)
- 代表模型:
Gemini-3.7-flash

本指南后续所有配置示例均以阿里云百炼和 DeepSeek 为例。使用其他平台时,只需替换相应的 API Key 和 API 地址。国外平台由于上述原因不便使用,本教程不作推荐。
三、利用 Cherry Studio 满足日常使用
下载 Cherry Studio
访问 Cherry Studio 官网 (opens new window),下载对应版本的软件并安装。
配置 Cherry Studio
打开设置,进入“模型服务”,选择“添加”。

为 API Key 的来源渠道命名,然后点击“确定”。

填入 API Key 和对应的 API 地址。下图以阿里云百炼为例,填写完成后点击“获取模型列表”。

点击想要使用的模型右侧的“+”进行选择,可以多选。下图所示状态即为已经选中,如同在菜市场采购一样简单。

点选完毕后,可以在模型列表中看到所有已选模型,并可在此界面反复修改、增删。

配置完毕后,回到对话助手界面,选择一个目标模型。

点选模型进行切换。

完成切换后,即可开始对话。


现在,你就可以像日常对话一样,与各个 AI 进行充分而富有创造力的交流了。
记得到模型服务商官网查询 API Key 的剩余额度,以免在不知情的情况下产生欠费。
进阶:Cherry Studio 对话界面
打开 Cherry Studio,映入眼帘的就是对话页面。
助手和话题
打个比方:你请了一位私人助理,第一天告诉他“你是我的翻译助理,风格要专业简洁”。
- 助手就是这位助理的“人设”——他叫什么、怎么说话、使用什么风格。
- 话题就是你们每次的具体对话——今天翻译这篇文章,明天翻译另一篇,各归各。
这样的好处是:不管你开启第几个话题,助理都记得自己是翻译助理,不需要每次重新介绍。话题之间互不干扰,但共享同一套设定。
使用起来大概是这样:在同一个“代码助手”下,可以分别创建“项目 A 的 Bug”和“项目 B 写作”两个话题,分开管理、互不影响。

输入框旁边的按钮
按钮很多,但日常使用的主要是下面几个,按需了解即可;按钮顺序可以长按拖动并自行调整。
| 名称 | 作用 |
|---|---|
| 上传附件 | 上传图片或文档供 AI 分析;图片需要模型支持“看图”能力 |
| 思维链长度 | 控制模型的思考预算。通常思考时长越久,回答质量越高 |
| 网络搜索 | 让 AI 搜索网页后再回答,适合询问最新资讯 |
| 知识库 | 将自己整理的资料提供给 AI,让它基于这些内容回答 |
| MCP 服务器 | 给予 AI 调用工具的权限,扩展 AI 的能力边界,需要提前配置 |
| 提及模型 | 临时切换另一个 AI 模型回答,同时保留当前上下文 |
| 快捷短语 | 保存常用提示词,并一键插入 |
输入框右下角还有“翻译”和“发送”两个按钮:前者将输入内容翻译成目标语言,后者用于发送消息(默认按 Enter 发送)。
输入框内还有两个容易混淆的功能:
- 清空消息:删除该话题内的全部聊天记录,删除后无法恢复。
- 清除上下文:消息仍然保留,但 AI 会从此“失忆”,不再记得此前的对话,相当于重新认识一次。
前者是真正删除消息,后者只是让 AI 忘记上下文,使用前需要区分清楚。
输入框角落里的数字

输入框右下角的数字显示当前对话大约使用了多少 Token,可以粗略理解为“字数”。这个数值仅供参考,实际费用仍以模型服务商的计算方式为准。
调整界面显示
右上角有设置入口,可以修改以下显示选项:
- 消息样式:可选择气泡或列表样式。
- 消息字体大小:文字较小时可以适当调大。
- 代码显示行号:如果经常让 AI 编写代码,开启后会更方便。
- 思考内容自动折叠:使用支持“深度思考”的模型时,AI 的推理内容可能很长;开启后会自动折叠。
- 长文本粘贴为文件:将大段文字粘贴进输入框时,内容会自动转为“文件”附件,避免撑满整个输入框。
助手设置
在左侧助手列表中右键点击助手名称,即可进入编辑页面。这里的修改会影响该助手下的所有话题。常用设置包括:
- 提示词:用于设定 AI 的角色。例如:“你是一个专业的英语翻译,只输出译文,不作解释。”设置后,每次对话都会默认携带这套设定。
- 温度(Temperature):控制 AI 回答的“发散程度”。写代码、查数据时可以调低,输出更稳定;写创意故事、进行头脑风暴时可以调高,让 AI 更活泼。默认值
0.7对大部分场景已经够用。 - 最大回复长度(Max Token):限制 AI 每次回答的长度。普通聊天设置为
500~800即可;写长文或代码时可以调到2000以上。数值过小可能导致回答中途被截断。 - 流式输出:AI 生成一个字,你就看到一个字。一般保持默认开启即可,只有模型不支持时才需要关闭。
由于篇幅有限,这里只介绍日常最常使用的功能。更多细节可以阅读 Cherry Studio 对话界面文档 (opens new window)。随着实际使用,自然会逐渐熟悉。
四、利用 Codex++ 转接其他模型到 Codex
下载 Codex++
前往 Codex++ Releases 页面 (opens new window),选择对应版本下载并安装。
登录 Codex
下面以通过 API Key 登录 Codex 为例。
打开 OpenAI 登录页面 (opens new window)并登录。也可以使用 Google、Outlook 邮箱或 GPT 账号登录。

登录后,点击左侧的“API Keys”,然后在 API Keys 页面点击右上角的“Create new secret key”。

为 API Key 命名,然后点击“Create secret key”。

点击“Copy”复制 API Key。建议将其保存在本地文件中;一旦关闭页面,就无法再次查看该 API Key,只能重新创建。确认已经保存后,再点击“Done”。

返回 API Keys 页面,可以看到刚刚创建的 API Key。

打开原版 Codex 桌面端程序(Codex App),选择“Sign in another way”。

在输入框中粘贴刚刚创建的 API Key,然后点击“Continue”。

登录成功后,点击左下角的“Settings”,可以看到“Logged in with API key”。

获取 DeepSeek API Key
登录后点击左侧的“API keys”,再点击页面右下方的“创建 API key”。

为 DeepSeek API Key 命名,然后点击“创建”。

点击“复制”保存 API Key。建议将其保存在本地文件中;一旦关闭页面,就无法再次查看,只能重新创建。确认已经保存后,再点击“关闭”。

返回 API Keys 页面,可以看到刚刚创建的 API Key。

配置 Codex++
本文以 Codex 接入 DeepSeek 为例。开始前请完全退出 Codex:除了关闭桌面窗口,还需要在任务栏中退出 Codex。
双击“Codex++ 管理工具”快捷方式。该快捷方式是安装 Codex++ 后自动创建的两个快捷方式之一。

Codex++ 会自动获取 Codex 的安装位置和版本信息。

点击左侧的“供应商配置”,再点击右侧的“添加供应商”。

按照下表填写信息。注意展开“更多选项”完成设置,填写后点击“保存”。
字段 填写内容 名称 DeepSeek接入模式 纯 API配置模型 deepseek测试模型(更多选项) deepseek-v4-flash(也可以从下方模型列表中选择其他模型)上下文大小(更多选项) 1000000(根据需要填写)压缩上下文大小(更多选项) 1000000(根据需要填写)Base URL https://api.deepseek.comKey 你的 DeepSeek API Key 上游协议 Chat Completions模型列表 填写 DeepSeek API Key 后,点击“从上游获取” 

找到新建的“DeepSeek 示例”,将鼠标移动到该栏,然后点击右侧出现的“使用”。

点击“使用”右侧的“发送 hi 测试”按钮,检查是否已经连通 DeepSeek。若显示 HTTP 200 和回复内容,说明配置成功。

使用增强版 Codex
双击 Codex++ 快捷方式。它是安装 Codex++ 后自动创建的两个快捷方式之一。

打开增强版 Codex 后,界面右上角会显示“Codex++”,旁边的绿点表示程序正在正常运行。对话框下方会出现 DeepSeek,可以切换并选择相应模型。

选择模型后即可正常使用。

Codex++ 使用注意事项
1. 从正确入口启动增强版 Codex
如果要使用增强版 Codex,或者使用已经接入 DeepSeek 等模型的 Codex,只能通过 Codex++ 快捷方式打开。打开原版 Codex 时,只能看到其自带的 OpenAI GPT 模型。
2. 根据模型文档填写配置
配置供应商时,需要参考相应模型的官方文档,仔细确认 Base URL,以及上游协议应选择 Responses API 还是 Chat Completions。
Codex++ 常见问题
1. Codex++ 菜单没有出现,怎么办?
确认你是从 Codex++ 入口启动,而不是从原版 Codex 启动。也可以打开管理工具的“诊断”和“日志”页面,查看注入状态。
2. Upstream worktree 和 Codex 原生创建有什么区别?
Codex++ 的 Upstream worktree 功能相当于先更新远端分支,再执行:
git worktree add -b <new-branch> <worktree-path> upstream/<base-branch>
这样,新 worktree 会从最新的远端跟踪分支开始,而不是从当前会话所在的本地 HEAD 开始。如果 Codex++ 无法安全识别当前 Codex 版本的原生 worktree 创建表单,请从 Codex++ 菜单中手动填写仓库路径、分支名、worktree 路径、remote 和 base branch。
五、Codex 官方使用
Codex 目前较常见的使用方式有两种:桌面端和 CLI(命令行界面)。下面按顺序介绍。
Codex 桌面端
桌面端可访问 ChatGPT 官网 (opens new window)下载安装。截至 2026 年 7 月 10 日,Codex 已有 Windows 端与 macOS 端;macOS 端通常会更早获得软件更新,功能体验也更超前,其余操作大体相似。本文以 macOS 端为例。
下载安装后,你会看到两类图标。这里将其与 ChatGPT 桌面端进行对比:OpenAI 在 2026 年 7 月 10 日对 macOS 上的两类应用进行了合并,请先从图标上加以区分(左侧为 ChatGPT,右侧为 Codex)。

打开 Codex 后,页面如下:

默认显示的是 Work 功能,也就是针对办公软件进行特调的模式。在这个模式下,Codex 可以操作基本办公软件(如 Office 等)完成任务,额度消耗与 Codex 模式相同。
同时,可以通过左上角切换为 Codex 模式。该模式针对开发者进行了特调,编码能力比 Work 模式更加优秀。

笔者建议使用 Codex 模式并搭配其他 Skills,这样可以尽可能发挥其编码能力并充分利用额度。
套餐与额度
时效提示: Codex 的界面、套餐名称与额度规则可能随版本更新而调整,请以客户端和账户页面的实际显示为准。
Codex 账号默认跟随 ChatGPT 账号。按照 ChatGPT 账号等级,原文将套餐概括如下:
- Free:默认免费套餐,可以使用基础功能;生图、深度思考和高级模型等功能受限,并限制对话次数。
- Go:解锁全部基础功能和模型,但生图量与高级模型调用(例如
5.6sol)仍有次数限制。 - Plus:解锁除 Pro 模型外的其他模型,通常可以满足日常使用;原文提到生图和思考模型调用不受限,并引用“对话约 300 次/天”的说法。
- Pro 5x:解锁 Pro 模型;Pro 模型为 OpenAI 当前的顶级模型,但调用次数有限,同时 Codex 额度约为 Plus 的 5 倍。
- Pro 20x:与 Pro 5x 类似,但 Codex 额度约为 Plus 的 20 倍。

额度进一步说明: 额度分为 5 小时内额度与一周内额度。5 小时额度达到 100% 后,会扣除周额度的 25%;5 小时额度耗尽后将无法继续使用 Codex,需要等待额度从周额度中恢复(即约 5 小时)后才能继续使用。周额度每周会自动重置为 100%。
对于正常使用 Codex 的用户,原文经验是:5 小时内的 100% 额度大约可进行 8~10 次 Codex 对话;笔者也遇到过单个较难任务消耗 44% 额度的情况。模型选择会显著影响额度消耗,模型越高级,消耗通常越快。原文建议使用
5.6sol并选择中等或高等 thinking。
在进行编辑的过程中,Codex 取消了 5 小时限制,目前默认额度为一周限额。需要自行调节使用强度,避免额度超限导致工作暂停。系统有时会赠送重置机会,即 reset;使用后周限额会立即回到 100%。重置机会有时间限制,过期即失效,请及时使用。

配置 Skills
要想更流畅地使用 Codex,仍需配置 Skills。这一步通常可以由 Codex 自行完成:在 GitHub 上寻找所需 Skills 并下载,再让 Codex 完成配置。如需手动配置,请将 Skills 添加到 Codex 根目录。

完成以上配置后,就可以较为流畅地使用官方 Codex。
使用 CCSwitch 接入 API
笔者还提供了另一种方法:使用 CCSwitch 转接官方 API 或其他 API,并通过 CLI(命令行界面)使用 Codex。
访问 CCSwitch 官网 (opens new window)下载安装 CCS。
安装完成后,切换到 Codex 界面。

点击右上角的橙色“+”按钮,按照界面要求添加供应商。

供应商名称可以自定义,官网链接可以不填写;API 请求地址则按实际获得的 URL 填写。使用自定义配置时,可以通过 CCS 接入 DeepSeek、MiniMax 等其他模型,方法相同。如果使用官方账号,下载安装 CCS 后直接使用即可,默认采用官方配置。

配置完成后,即可使用 CLI。
使用 Codex CLI
如果是第一次使用 Codex CLI,需要先安装 CLI。三种常见系统的安装方式如下:
- Windows:安装 Git Bash 和 Node.js 22+,然后在 CMD 或 PowerShell 中执行
npm install -g @openai/codex。 - macOS:通过官网或 Homebrew 安装 Node.js 22+,然后在终端执行
npm install -g @openai/codex;权限不足时可在命令前添加sudo。 - Linux:使用
apt、dnf或pacman安装 Node.js 22+,然后执行sudo npm install -g @openai/codex。
安装完成后,打开终端并输入:
codex
即可启动 Codex CLI。

在该页面中,可以输入 / 查看和调整模式。

相关设置通常保持默认即可,也可以在 /model 中更改模型。
如果需要在 CLI 中添加图片等附件,可以使用 @ 搜索文件。需要注意 Codex 工作文件夹与目标文件所在文件夹之间的包含关系:目标文件必须位于 Codex 的工作文件夹中,才能被搜索到。下图中 Codex 在全局范围使用,而图片位于 Desktop 文件夹,因此可以找到。

到这里,就可以算是入门了 Codex 的使用。后续高级功能请在实践中继续探索。