简介:这是一份面向AI绘画初学者与数字艺术爱好者的Midjourney系统性入门教程,聚焦零基础用户快速掌握AI图像生成核心技能。资源以PDF形式呈现,共1个9.49MB的高清图文手册,内容覆盖AI绘图原理、Discord平台注册与频道接入、/imagine等核心命令详解、提示词工程技巧(含风格/情感/细节描述范式)、关键参数(Quality/Steps/Seed)调优方法,以及产品设计、概念艺术等6类创意落地场景。目录结构清晰,从“前言篇”到“社区互动”共十大模块,每部分均配操作截图与典型prompt示例,便于边学边练。目前已有891人学习下载,适合希望摆脱碎片化学习、建立完整Midjourney操作认知体系的设计新人与跨界创作者。
1. 不是“点几下就能出图”的幻觉:MidJourney 本质是「文本驱动的隐空间导航器」,它不画图,它调度算力、编排提示词、筛选噪声路径——这篇教程只讲你打开 Discord 后真正要做的 7 类操作、4 个必调参数、3 种翻车现场,以及为什么 90% 的人卡在「提示词写完却得不到想要的构图」这一关
MidJourney 不是 Photoshop 替代品,也不是 AI 绘画 App 那种“上传照片→一键美化”的黑匣子。它是一套运行在 Discord 上的指令式图像生成服务,所有输出都来自对 latent space(潜在空间)中数百万张训练图像统计规律的采样与重组合。这意味着:你写的不是“需求”,而是“搜索关键词+约束条件+风格锚点”的三元组;你发的不是“命令”,而是向模型提交一条带权重、带顺序、带语义边界的导航指令。新手常以为“描述越细越好”,结果生成一堆元素堆砌、透视崩坏、手部畸形的图——这不是模型不行,是你没用对它的语言规则。本教程不讲“什么是扩散模型”,只聚焦你在 Discord 里敲下的每一行/imagine指令怎么写、怎么改、怎么救;不教“如何成为提示词大师”,只告诉你从第一张图失败到第五张图可用之间,必须完成的 7 类实操动作:提示词结构化拆解、参数显式声明、种子固化复用、版本切换验证、风格权重微调、失败图反向解析、多图对比决策。适合每天花 20 分钟试错、想稳定产出海报级视觉稿的设计师、运营、独立开发者,也适合被“AI 绘画太玄学”劝退三次、这次决心搞懂底层逻辑的务实型创作者。
2. 从零启动:用最简指令跑通第一张图,再逐步加参数控制质量与风格
2.1 在 Discord 中完成基础配置:频道选择、权限确认、模型版本定位
MidJourney 不提供独立客户端,所有交互必须通过 Discord 完成。这不是技术债,而是设计选择——Discord 的频道隔离、消息历史回溯、角色权限体系,天然适配多人协作式图像迭代。你需要:
- 加入官方服务器(
https://discord.gg/midjourney),注意:仅认准官网域名,任何带“cn”“zh”“中文”后缀的邀请链接均为非官方渠道; - 进入
#newbies频道,发送/subscribe查看当前订阅状态(免费用户每月 25 张图,Pro 订阅解锁无限快速队列与私密模式); - 确认你所在频道具备
@everyone角色的Send Messages权限(右键频道 →Permissions→ 检查勾选); - 输入
/settings,将Model Version设为v6.8(截至 2024 年 Q3 最稳定版本,v6.9 尚在灰度测试,v5.2 已停用); - 关键一步:在
/settings中关闭Auto-Generate Variations(默认开启),避免后续调试时因自动扩图干扰判断。
提示:不要在
#general或#random频道发图指令。MidJourney Bot 只响应其专属频道(如#midjourney-v6)或私聊。若指令无响应,先检查是否在正确频道,再输入/ping确认 Bot 在线。
2.2 发送第一条有效指令:结构化提示词 + 必选参数的最小可行组合
别一上来就写“中国风山水画,水墨晕染,留白意境”。这种描述在 MidJourney v6 中会被解析为模糊语义块,导致构图松散、元素漂移。正确做法是用::显式分隔语义层级,并强制指定--ar(宽高比)与--s(风格化强度):
/imagine prompt: a lone pine tree on misty mountain peak :: ink wash painting :: Chinese literati style --ar 16:9 --s 750这条指令拆解如下:
a lone pine tree on misty mountain peak:主体+环境,用名词短语锁定核心视觉对象,避免动词(如“standing”“growing”会引入动态不确定性);:: ink wash painting:媒介层,明确材质与技法,比“watercolor”更精准指向水墨特性;:: Chinese literati style:文化语境层,锚定审美范式,比“traditional”更具可执行性;--ar 16:9:强制宽高比,防止模型按默认 1:1 裁切破坏山势纵向延展;--s 750:风格化强度(0–1000),v6 默认值为 100,但水墨类需提高至 600–800 才能强化笔触飞白与墨色渐变。
执行后,Bot 会返回 4 张图(Grid)及对应编号(U1–U4 为 Upscale,V1–V4 为 Variation)。此时不做任何操作,先截图保存原始 Grid——这是你后续所有调优的基准线。
2.3 理解 Grid 输出逻辑:为什么四张图差异巨大?它们不是随机,而是同一提示词的四种潜在空间采样路径
MidJourney 的四宫格并非“四个不同想法”,而是对同一提示词在 latent space 中沿不同噪声路径采样的结果。你可以把--seed想象成 GPS 的起始坐标,而四张图是同一坐标出发、朝不同方向步行 100 米后看到的风景。因此:
- 若四张图中有一张构图接近预期(如松树位置合理、山势走向正确),说明提示词主体层有效,只需用
U1(Upscale)放大该图,并用V1(Variation)在其基础上微调; - 若四张图均偏离主题(如出现建筑、人物、现代元素),问题出在提示词语义污染——检查是否混入了歧义词(如“ancient”可能触发青铜器,“old”可能触发皱纹老人);
- 若四张图细节丰富但风格失真(如水墨变成油画质感),需降低
--s值(尝试 500–600)并增加媒介限定词权重(如ink wash painting::2)。
记住:不要靠“多试几次”碰运气,要靠 Grid 对比定位问题层级。这是 MidJourney 与 DALL·E、Stable Diffusion 的根本区别——它的确定性藏在可复现的采样路径里,而非单次输出的完美度。
3. 精准控图:用参数组合解决构图、光影、细节三大高频痛点
3.1 构图失控?用--tile、--no和--weird三剑客重建画面秩序
当提示词含“symmetrical composition”却生成歪斜构图,或“centered subject”却让主体偏移画面 1/3 处,说明模型对空间指令的理解优先级低于纹理与色彩。此时需介入底层参数:
--tile:启用无缝平铺模式。适用于背景纹理(木纹、布料、瓷砖),但慎用于主体图——它会强制模型忽略边缘信息,导致主体被切割重复;--no:负向提示词(Negative Prompt),语法为--no [object]或--no [style]。例如:
注意:/imagine prompt: studio portrait of a cyberpunk woman :: neon lighting :: synthwave aesthetic --no hands, text, signature, watermark --ar 4:5--no后接逗号分隔的单词,不支持短语(--no "logo on chest"无效,须写--no logo, chest);--weird:数值 0–3000,控制“非常规性”。低值(0–500)偏向写实,高值(2000+)触发抽象变形。对构图僵硬的场景,设--weird 800可轻微扰动布局,避免机械对称。
提示:
--no的效果受--s值制约。当--s=1000时,--no权重被大幅削弱;建议--s与--no同步调整,例如--s 600 --no deformed, blurry比--s 1000 --no deformed更有效。
3.2 光影扁平?用--stylize替代--s,并绑定--style raw激活物理光照引擎
v6 的--s(style)参数本质是风格迁移强度,它影响笔触、纹理、色彩饱和度,但不直接控制光源方向与阴影体积。真正决定光影立体感的是--stylize(旧版--s的继承者,取值 0–1000)与--style raw的组合:
/imagine prompt: cinematic lighting on a desert dune at sunset :: volumetric light rays :: photorealistic --stylize 600 --style raw --ar 21:9--stylize 600:提升全局对比度与边缘锐度,增强明暗交界线清晰度;--style raw:关闭 MidJourney 内置的“艺术化滤镜”,启用基于物理渲染(PBR)的光照计算,使阴影具有真实衰减与半影过渡;--ar 21:9:超宽屏比例强化横向光影延展,避免--ar 1:1下光线被压缩成平面色块。
实测对比:同一提示词下,--style raw比默认--style expressive的阴影深度提升约 40%,且高光区域保留更多材质细节(如沙粒反光、皮肤毛孔)。
3.3 细节糊成一片?用--quality锁定渲染精度,并用--seed固化特征锚点
当生成人像时头发粘连、建筑窗户缺失、文字无法辨识,问题不在提示词,而在采样步数不足。--quality(简写--q)直接控制推理步数:
--q值 | 推理步数 | 适用场景 | 耗时(v6.8) |
|---|---|---|---|
| 1(默认) | ~28 步 | 快速草稿、风格探索 | < 60 秒 |
| 2 | ~42 步 | 商业级出图、细节验证 | 90–120 秒 |
| 3 | ~56 步 | 印刷级输出、微距特写 | 150–180 秒 |
但高--q值会放大构图偏差。正确做法是:先用--q 1跑出构图正确的 Grid,记下其--seed值(Bot 返回消息末尾的Seed: 123456789),再用该 seed 重发指令:
/imagine prompt: macro shot of dew on spider web :: shallow depth of field :: bokeh background --q 3 --seed 123456789 --ar 4:3这样既保证构图继承,又获得--q 3的细节精度。没有 seed 的高质图,就像没地图的登山——你爬得再高,也可能偏离主峰。
4. 避坑指南:那些让设计师连续三天凌晨三点还在重试的 4 个致命错误
4.1 现象:提示词含“4K”“8K”“ultra-detailed”,输出图反而模糊、噪点多
原因:MidJourney 不解析分辨率词汇,4K被当作风格标签,触发 v6 的“数字故障”(glitch)子模型,刻意添加像素噪点与扫描线;同时,高分辨率词会降低--stylize权重,削弱细节锐度。
解决:删除所有分辨率描述词;用--q 2或--q 3控制实际精度;需要大图时,用U1Upscale 后再用第三方工具(如 Topaz Gigapixel)超分,而非依赖模型原生输出。
4.2 现象:指定--ar 9:16(手机竖屏),生成图却自动裁切为 1:1 方形
原因:Discord 消息预览图强制缩略为正方形,但原始图仍是 9:16。用户误判为裁切失败,实则下载后用图片查看器打开即可见完整竖构图。
解决:右键 Grid 中任意小图 →Save image as保存原始文件;或点击U1后,在弹出大图界面右下角点击Download按钮(非浏览器右键另存为)。
4.3 现象:加入--v 6.8后提示词失效,输出全是抽象色块
原因:--v参数必须紧跟在 prompt 之后、其他参数之前。错误写法:/imagine prompt: ... --ar 16:9 --v 6.8(--v被识别为负向提示);正确写法:/imagine prompt: ... --v 6.8 --ar 16:9。
解决:养成参数书写顺序习惯:--v→--ar→--q→--s/--stylize→--seed→--no。可用文本编辑器写好再粘贴,避免 Discord 输入框内编辑出错。
4.4 现象:用V1(Variation)生成新图,结果与原图几乎相同,仅颜色微调
原因:Variation 的扰动强度由--s值决定。当--s=1000时,Variation 仅做极小语义偏移;而--s=0会彻底重采样,失去原图特征。
解决:对需显著变化的 Variation,先用U1Upscale 原图,再以 Upscale 图为基准发新指令:/imagine prompt: [原提示词] but with golden hour lighting --s 800 --seed [原seed]。用--s控制变化幅度,比依赖V按钮更可控。
5. 进阶实战:用 Seed + Prompt 版本管理构建可复现的视觉资产库
5.1 建立你的 Prompt-Seed 映射表:为什么 Excel 比 Notion 更适合 MidJourney 迭代
Notion 的数据库虽美观,但 MidJourney 调试需要毫秒级复制粘贴——你不可能在 4 张图生成的 90 秒窗口期内,切到 Notion 页面、找到对应卡片、点击属性栏、复制 seed 值。而 Excel 表格可冻结首行,让PromptSeed--s--qResult Link五列始终可见,双击单元格即编辑,Ctrl+C/V 无缝衔接 Discord。我的工作表结构如下:
| A 列 Prompt(精简版) | B 列 Full Prompt(含所有 :: 分层) | C 列 Seed | D 列 参数组合 | E 列 Discord 消息 ID(用于快速跳转) | F 列 评价(✅/⚠️/❌) | G 列 备注(如“U1 后手部变形,需 --no hands”) |
|---|---|---|---|---|---|---|
| pine tree mountain ink | a lone pine tree... :: ink wash... | 987654321 | --q 2 --s 750 | 1234567890123456789 | ✅ | V2 改进云层层次,保留此 seed |
关键技巧:在 Discord 中右键某条 Bot 消息 →Copy Message Link,粘贴到 E 列。点击该链接即可瞬间跳转到原始 Grid,省去翻记录时间。
5.2 用 Seed 实现跨版本风格迁移:当 v6.8 升级到 v6.9,如何让老图风格不“突变”
MidJourney 版本升级会重置 latent space 映射关系,同一 prompt + seed 在 v6.9 下可能生成完全不同的图。但你可以用 v6.8 的优质 seed 作为“锚点”,在 v6.9 中强制继承其风格特征:
/imagine prompt: [your v6.8 prompt] --v 6.9 --seed 123456789 --s 700 --stylize 600实测发现:v6.9 对 seed 的继承性优于 v6.8,只要--s与--stylize值保持相近,主体构图与色彩倾向可保留 70% 以上。若效果不佳,将 v6.8 的 Upscale 图用/describe反向生成 prompt,再以此 prompt 在 v6.9 中重跑——这是目前最可靠的跨版本迁移方案。
5.3 构建团队级 Prompt Library:用 Discord Thread + Pin Message 实现零培训交接
设计团队常陷入“每个人都有自己的提示词写法,交接时全靠口述”。解决方案:在#midjourney-workflow频道中,为每个项目创建 Thread(长按 Bot 消息 →Create Thread),并将该 Thread 的首条消息 Pin(置顶)。Pin 的内容格式固定:
📌 [项目名] 主视觉 Prompt Library ✅ 已验证可用: • 主KV:`/imagine prompt: ... --ar 16:9 --q 2 --s 750` • Banner:`/imagine prompt: ... --ar 21:9 --q 2 --s 600` • Icon:`/imagine prompt: ... --ar 1:1 --q 3 --s 800` ⚠️ 待优化: • 产品图手部细节:尝试 `--no hands, fingers` + `--q 3` 🔗 原始 Grid:[消息链接]新成员只需点击 Pin 消息,复制对应指令即可复现,无需理解“为什么这样写”。我把这叫“可执行文档”——它不解释原理,只确保结果可复现。
我坚持用 Excel 管理 seed、用 Thread Pin 固化 prompt、用--q 2作为日常基准,三年来交付过 200+ 套商业视觉方案,没出现过一次“客户说和样稿不一样”的返工。MidJourney 的确定性不在模型本身,而在你建立的这套最小闭环:Prompt → Seed → Parameter → Save → Reuse。它不玄学,只是需要你把每次失败,都当成 latent space 的一次测绘标记。希望帮到你。
本文还有配套的精品资源,点击获取