老刘带 6 人小队给省级生态环境厅做污染溯源推演助手。客户口头说:日常监测问询走静态查询,扩散推演必须按气象和排放滚动更新,跨市联防必须先对齐世界状态再给结论。结果 Qwen 把所有工单当百科问答,从来不改状态;DeepSeek 看见浓度数字就编一套漂亮的扩散轨迹;Kimi 窗口一短,把上一小时的风向当当前状态交差。群里改三天提示词,线上又漂回去。隔壁路过一句:别再拿聊天记录当世界状态表,把状态契约、观测更新、推演预算和失败回退写进 SPEC。
世界模型到底管什么
世界模型不是再写一句「请认真推理」。它管的是:这一单里,模型脑子里那张「现在的世界」从哪来、怎么更新、能推多远、推崩了怎么办。
四件套其实很朴素:
- 状态契约:世界里允许出现哪些实体和字段。风向、风速、排放口、浓度、行政区划,枚举写死;不允许临时发明第四类污染物通道。
- 观测更新:新监测数据进来,必须覆盖旧状态,而不是和旧状态并行讲两套故事。
- 推演预算:日常问询不准开长推演;跨市联防才允许滚动 N 步;步数、超时、token 都有上限。
- 失败回退:状态对不齐、观测缺失、推演超时,标 uncertain 并升级人工,禁止用上一单的世界交差。
值班室比喻最清楚:检索管从哪找档案,结构化输出管交出去的单子算不算过关,世界模型管的是沙盘上的棋子有没有按最新观测摆好。
为什么 2026 必须认真对待
交付已经从能聊变成能进值班系统。污染溯源、路网调度、库存推演,本质都是「先有一个可更新的世界,再在上面做决策」。多基座对状态服从度差一个数量级:同一套口头规则,Qwen 爱静态答,DeepSeek 爱编轨迹,Kimi 爱截断。规则写在群公告最容易漂。私有化场景更吃这一套——监测数据出不了网,你不能把沙盘状态散落在个人聊天里。
落地三道坎
- 环境不稳:本地脚本 Mock 一套状态,云端监测接口又是另一套,对齐全靠感觉。
- 模型不灵:一套提示词只在某一个基座会按状态走,换模型就发明新字段。
- 规则易飘:推演步数、超时、升级条件改在群里,过两天没人说得清线上到底用哪一版。
MonkeyCode 怎么把这一套跑通
MonkeyCode 是免费、免安装的在线 AI 开发平台,浏览器打开就能干。每任务带真实云端环境,编译、测试、预览都在云端。GLM、Kimi、MiniMax、Qwen、DeepSeek 可按任务一键切换,方便把被测和对照拆开交叉验证。需求与 SPEC 管理能把角色、红线、状态字段、观测更新、推演步数、失败回退写成可版本化的契约,而不是聊天记录。完全开源,支持私有化,适合有网络隔离的厅局团队。基础版免费;专业会员 99 元/月,旗舰会员 499 元/月。
三步实战
第一步,新建任务。主实验用 Qwen,对照用 DeepSeek,短窗口基线用 Kimi。裁判不要和被测同家。
第二步,把规则写进 SPEC。
- 角色:省级生态环境厅污染溯源推演助手,不是科普博主,也不是应急指挥。
- 红线:不编造浓度和风向;不确定就升级人工;企业名称、信用代码、精确坐标脱敏;禁止把监测里不存在的排放口写进结论。
- 状态契约:wind_dir / wind_spd / outlet_id / conc_pm / region_code,不允许额外状态通道。
- 观测更新:新监测覆盖旧状态;口述与监测冲突以监测为准;监测缺失标 uncertain。
- 推演预算:faq_simple 禁止开推演;plume_roll 最多 6 步、超时 10 秒;cross_city 必须先对齐状态再推演。
- 校验:解析失败或缺必填重试一次,仍失败升级;禁止在状态未对齐前输出结论。
- 输出:state_ok / plume_steps / upgrade / reason,不对值班员展示思维链。
第三步,同批 20 条口述加监测对比。编造监测中不存在的排放口 7→0,用上一小时风向交差 5→0,跨市联防未对齐状态就给结论 4→0。Kimi 短窗口截断状态被回退拦住。
四点建议
小任务试点,先跑 20 条再谈全面替换。规则写进 SPEC,不要写在群公告。多模型交叉验证,别让被测和裁判同家自评自夸。敏感监测数据走私有化,云端跑通的是方法和门禁,不是把厅局数据送上公网。
世界模型不是科幻名词。它就是那张必须被观测更新、被预算约束、被门禁拦住的沙盘。把沙盘写进 SPEC,比再改三天提示词管用。