文章目录
- 一、为什么需要「拷问」而不是「review」
- 二、`grill-me` 是什么
- 三、快速上手(3 步)
- 1. 发现
- 2. 安装
- 3. 触发
- 四、实战回放:从 PRD v1.0 到 v1.1
- 4.1 会话主链
- 4.2 第一轮:愿景合格,规格不合格
- 4.3 第二轮:一句澄清改变产品形态
- 4.4 落地与二次拷问
- 五、前后对比
- 六、你可以直接复用
- 七、总结
- 参考链接
- 相关推荐
本文记录一次完整实战:用 AI 写了一份「看起来很完整」的 Android PRD,再用
grill-meSkill 做结构化拷问,把愿景文档收敛成PRD v1.1,并推进到工程落地。
环境:Cursor + Node.js +npx skills·案例项目:离线职场英语口语 APP(Kotlin + Compose)
一、为什么需要「拷问」而不是「review」
用 AI 写 PRD 很快,但常见问题也很典型:
- 承诺100% 离线,却没考虑
SpeechRecognizer在大量机型上要联网 - 写系统翻译,实际要 API 34+ 且首次下载语言包常需网络
- 写模糊匹配评分,却没定义同义词、阈值和毕业标准
普通「帮我 review 一下」往往得到「结构清晰,建议补充 xxx」。/grill-me的区别是:直接说「不能直接开工」,抛出 A/B/C 决策题,逼你拍板,最后输出可执行的 diff。
| 普通 review | /grill-me |
|---|---|
| 泛泛建议 | 「不能直接开工」+ 具体硬伤 |
| 不要求决策 | 必答题,必须拍板 |
| 建议清单 | 可执行 diff(+门禁、-中文 TTS、阈值表) |
| 通常只审文档 | 可跨阶段:PRD → 代码 → 数据 |
二、grill-me是什么
| 项 | 内容 |
|---|---|
| 来源 | mattpocock/skills · skills.sh 详情页 |
| 安装量 | 680K+(2026-07) |
| 一句话 | A relentless interview to sharpen a plan or design |
| Skill 正文 | 仅一句:Run a /grilling session. |
| 触发方式 | 用户主动(disable-model-invocation: true,不会自动调用) |
同作者相关 Skill:grill-with-docs(带文档对照审)、batch-grill-me(批量拷问)。中文镜像:vinvcn/mattpocock-skills-zh-cn@grill-me。
前置条件:Node.js + npx、支持 Agent Skills 的 IDE(本文用 Cursor)、一份待审 PRD / 设计 / 架构文档。
三、快速上手(3 步)
1. 发现
# CLI 搜索npx skillsfindgrill或在 skills.sh 搜grill,按安装量排序。也可在 Cursor 里问:「有没有 Skill 可以像面试官一样追问产品方案?」
2. 安装
npx skillsaddmattpocock/skills@grill-me-g-y| 参数 | 含义 |
|---|---|
-g | 用户级安装,所有项目可用 |
-y | 跳过确认 |
安装后路径:~/.agents/skills/grill-me/SKILL.md。更新:npx skills update。
3. 触发
在 Cursor 对话输入/grill-me,附上 PRD 全文;或用@手动附加Grill MeSkill。
输入技巧:
| 推荐 | 避免 |
|---|---|
| 附上完整 PRD + 技术约束 | 只说「这个 APP 行不行」 |
| 用编号回答决策题 | 「都可以」「你定」 |
| 主动抛一句话原则 | 等问完才发现方向错了 |
实现一部分代码后,可再次/grill-me,让 Agent 基于 README + 源码继续追问——本文案例的第二轮就是这么用的。
四、实战回放:从 PRD v1.0 到 v1.1
4.1 会话主链
PRD v1.0 + /grill-me → 第一轮:硬伤 + 5 道必答题 → 用户拍板 → 第二轮:决策验收 + 4 道追问 → 用户澄清「中文只显示不朗读」→ PRD v1.1 定稿 → 创建 Android 项目(W1 骨架) → 对着代码再 /grill-me → 导出 docs/PRD_v1.1.md| 阶段 | 产出 |
|---|---|
| 文档拷问 | 三轮问答 → PRD v1.1 |
| 工程落地 | Compose 脚手架 + 核心练习 + 评分引擎 |
| 代码复盘 | 5 个实现层追问 |
| 沉淀 | PRD 落盘,README 补链 |
4.2 第一轮:愿景合格,规格不合格
AI 裁决:方向对,不能直接开工。核心硬伤三条:
SpeechRecognizer与「100% 离线」冲突- 系统翻译 ≠ 离线整句翻译
- Levenshtein 评的是 STT 文本,不是发音
5 道必答题(不答完不出定稿):
1. STT 离线失败:阻断 / 文本替代 / 仅提示装语音包? 2. 翻译 MVP:词典还是整句? 3. 56 天终点:哪 3 个场景算「能交流」? 4. 用户路径:线性解锁还是入学分流? 5. MVP 时间盒:6 / 10 周?用户拍板:仅提示装语音包 · 6000 词词典(整句 v2)· 工作/餐厅/日常三场景 · 入学分流 · 6 周做全。
4.3 第二轮:一句澄清改变产品形态
AI 对拍板做验收(如「仅提示装语音包」须补启动门禁),并追问听力模式、毕业考时机等。
关键转折——用户一句澄清:
会中文的人学英语,读英文即可,中文不需要读。
据此砍掉中文 TTS/STT,「听英文说中文」改为听英选中文(四选一)。定稿定位:
给会中文的人用的离线英语口语 APP:看中文、听英文、说英文;中文只显示、不朗读。
- 100% 离线 / 中英双向语音 / 模糊匹配 / 系统整句翻译 + 配好英文语音包后离线 / 仅英文 TTS·STT / 阈值+同义词表 / 6000 词词典 + 听英选中文 · 三场景 14 题毕业考 · 入学三档分流4.4 落地与二次拷问
W1 交付:Compose 底部导航、语音环境门禁、入学分流、Room 种子数据、三种核心练习、ScoringEngine。
对着代码再/grill-me,典型追问:
- 无语音包用户被门禁挡住,有没有 Plan B?
- 同义词表为空时,评分引擎如何判等价?
- W1 只有 3 天课,入学分流差异体现在哪?
- 56 课 + 6000 词,APK 体积与内容迭代策略?
- 艾宾浩斯复习数据,W2 能否平滑迁移?
最后将 PRD v1.1 从对话 transcript 导出至docs/PRD_v1.1.md——拷问结果必须落盘,聊天不是文档仓库。
五、前后对比
| 维度 | v1.0(grill 前) | v1.1(grill 后) |
|---|---|---|
| 定位 | 像多邻国的离线英语 APP | 会中文者练口语:看中文、听英文、说英文 |
| 离线 | 100% 离线 | 配英文语音包后可用 |
| 语音 | 英 + 中 TTS/STT | 仅英文 TTS/STT;中文只显示 |
| 听力 | 听英文说中文 | 听英选中文 |
| 评分 / 毕业 | 模糊匹配 + KPI 百分比 | 阈值 + 同义词表 + 三场景可测毕业考 |
| 状态 | 愿景文档 | 可开工 → 已实施 W1 |
定位窄了,但能做出来的概率高了几个数量级。
六、你可以直接复用
# 1. 安装npx skillsaddmattpocock/skills@grill-me-g-y# 2. 准备 PRD / 设计 / 架构说明# 3. Cursor 对话/grill-me<粘贴你的方案># 4. 用编号回答 AI 抛出的决策题# 5. 要求输出「可开工版」并落盘到 docs/# 6. 实现后再 /grill-me,对着代码追技术债三条原则:
- 上下文一次给齐— PRD、技术栈、约束不要让人猜
- 主动抛一句话原则— 「中文不需要读」往往比改十个功能点更有效
- 结果必须落盘— transcript 会丢,文档不会
七、总结
/grill-me的 Skill 正文只有一行,但它激活的是一套产品决策压缩器:
- 把隐含矛盾逼到台面(离线 vs STT、评分 vs 发音)
- 把模糊承诺变成可测标准(毕业考 14 题、评分阈值)
- 把聊天纪要变成可落盘的工程规格(PRD v1.1 →
docs/)
如果你也在用 AI 写 PRD、技术方案或架构设计,不妨装一个grill-me,在写第一行代码之前先过一轮「评审面试」。
参考链接
| 资源 | 地址 |
|---|---|
| grill-me | https://skills.sh/mattpocock/skills/grill-me |
| 作者仓库 | https://github.com/mattpocock/skills |
相关推荐
Android 工程师的 AI 搭档:Android CLI + Skills 实战笔记
Ollama 本地高效部署DeepSeek模型深度搜索解决方案