gstack /codex第二意见:用OpenAI Codex做跨模型代码评审的3种模式
【免费下载链接】gstackUse Garry Tan's exact Claude Code setup: 23 opinionated tools that serve as CEO, Designer, Eng Manager, Release Manager, Doc Engineer, and QA项目地址: https://gitcode.com/GitHub_Trending/gs/gstack
gstack复刻了 Garry Tan 的 Claude Code 工作流,内置 23 个"专家角色"技能;其中的/codex技能是它的招牌功能之一:一键调用 OpenAI Codex CLI,为你的代码提供跨模型代码评审。同一份代码,换一个"大脑"再看一遍——它内置了Review(评审)、Challenge(对抗挑战)、Consult(顾问咨询)3 种模式,分别对应上线前把关、安全压力测试和深度问答。
为什么需要"第二意见"?
自己写的代码自己审,很容易"灯下黑":AI 生成的代码尤其如此,因为它会"自信地解释错误"。gstack 的/codex把另一个 AI 系统(OpenAI Codex)请来当独立评审官,文档里甚至戏称它是"那个 200 IQ 的毒舌开发"——直接、简短、不捧场,只指出问题(见 codex/SKILL.md)。
两个不同模型对同一 diff 的评审结论会互相印证:都发现的问题,基本就是真问题。gstack 的作者 Garry Tan 本身就是高产开源作者,这套工作流正是他日常开发方式的完整复刻。
三种模式:怎么选?
| 模式 | 触发指令 | 适合场景 | 结果形式 |
|---|---|---|---|
| Review 评审模式 | /codex review | 合并前对分支 diff 做常规评审 | GATE: PASS / FAIL 门禁 |
| Challenge 对抗模式 | /codex challenge | 上线前做安全与容错压力测试 | 逐条问题清单 |
| Consult 顾问模式 | /codex <问题> | 问架构、审方案,支持追问 | 开放式对话 |
完整定义见 codex/sections/ 目录下的三个模式文件。
模式一:Review 评审——带通过/失败门禁的 diff 审查
这是最常用的模式。它会对当前分支相对基础分支的 diff 运行独立评审,并用严格的门禁(Gate)机制给出结论(详见 codex/sections/review-mode.md):
- 发现
[P0]/[P1]级别严重问题 →GATE: FAIL - 只有
[P2]建议级问题 →GATE: PASS - 输出为空、没打标签、或 Codex 本身没跑完 → 一律FAIL(fail-closed 失败关闭)
🔒 这里有个值得学习的工程设计:门禁失败关闭——"验证不了"就等于"没通过",绝不因为输出缺失而误报通过。评审全程锁定只读沙箱,Codex 只能看代码、改不了代码。
评审结束后还会输出 token 消耗与预估成本,并在结尾强制给出一行Recommendation:建议,告诉你下一步该修哪条、为什么(见 review-mode.md)。
模式二:Challenge 对抗模式——让 Codex 试图"搞垮"你的代码
如果说 Review 是"找茬",Challenge 就是"扮演攻击者"(详见 codex/sections/challenge-mode.md)。它会给 Codex 下达这样的任务:
"像攻击者和混沌工程师一样思考。找出边界条件、竞态条件、安全漏洞、资源泄漏、静默数据损坏路径。别客气,不要赞美——只说问题。"
✨ 亮点有两处:
- 可指定聚焦方向,比如
/codex challenge security,就专门从注入、认证绕过、提权、时序攻击等角度找漏洞 - 实时流式展示思考过程:输出中以
[codex thinking]标出推理轨迹、[codex ran]标出它实际执行的命令,你能看到第二意见是怎么"想"出来的
这个模式适合支付、鉴权、队列这类出事故代价高的模块。
模式三:Consult 顾问模式——把 Codex 当技术顾问
前两种模式盯着 diff,Consult 模式则是自由问答:架构是否合理、这段实现有没有更简单的方案、这个设计有没有隐藏风险(详见 codex/sections/consult-mode.md)。
两个实用细节:
- 会话连续:会话 ID 存在
.context/codex-session-id,下次可以继续追问,Codex 记得上文 - 自动识别方案评审:如果你让它审计划文档,gstack 会把全文直接嵌入提示词——因为 Codex 被沙箱限制在仓库根目录内,看不到仓库外的文件,直接告诉它路径只会白白浪费工具调用
另外每个模式给 Codex 的提示词都会先附加一段"文件系统边界"指令,防止它去读、改 gstack 自己的技能定义文件(如 agents/openai.yaml),避免跨系统干扰。
跨模型对比:把两家的意见"对账"
/codex review最强大的场景是:先跑 Claude 自己的/review,再跑 Codex 评审,然后 gstack 会自动输出一份对账报告:
CROSS-MODEL ANALYSIS: Both found: 两个模型都发现的问题 Only Codex found: 仅 Codex 发现 Only Claude found: 仅 Claude 发现 Agreement rate: X% 一致率📊 两模型都命中的问题优先修;只有单侧发现的,值得人工看一眼。文档中明确的原则是:跨模型一致只是建议,不是决定——最终由你拍板(见 review-mode.md)。
快速上手:如何触发
gstack 已装好后,直接用自然语言或指令触发即可,常见触发词包括(见 SKILL.md 的 triggers 定义):
codex review/second opinion→ 评审模式outside voice challenge→ 对抗模式ask codex/consult codex→ 顾问模式
还可以追加--xhigh参数,把推理强度从 high 提到 xhigh,换取更深度的分析。
💡给新手的小结:合并前跑一次review把关,关键模块上线前跑一次challenge security压测,拿不准的架构问题用consult问个第二意见——三种模式覆盖了"日常、高危、疑难"三类场景,一套指令即可完成跨模型代码评审。
延伸阅读
- 项目总览与安装说明:README.md
- codex 技能主文件:codex/SKILL.md
- 三大模式实现:review-mode.md / challenge-mode.md / consult-mode.md
- 项目架构:ARCHITECTURE.md
【免费下载链接】gstackUse Garry Tan's exact Claude Code setup: 23 opinionated tools that serve as CEO, Designer, Eng Manager, Release Manager, Doc Engineer, and QA项目地址: https://gitcode.com/GitHub_Trending/gs/gstack
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考