前两年做营销投放的时候,我们团队最头疼的事情就是物料的产出效率。一个活动页面、一组信息流广告、一条短信推送,从策划到文案再到设计,周期的瓶颈往往不在人的能力,而在产能的物理上限。后来大模型这套东西开始在企业里落地,货拉拉的营销广告场景也逐步引入了相关技术,我们才真正感觉到,内容生产这件事,从“靠人堆”变成了“靠算力堆”。
这篇内容源自我们内部的一次实践分享。简单来说,就是把大模型应用到货拉拉的营销广告全链路里,包括广告文案自动生成、多版本创意批量生产、用户人群理解、投放策略辅助等工作。不吹不黑,这里面有实打实的效率提升,也有预想不到的坑。本文适合三类人看:一是做营销增长、日常被物料产出逼疯的业务同学,二是做大模型应用落地、正在找场景的算法工程师,三是想了解企业在真实业务里怎么用大模型、而不是停留在demo阶段的技术管理人员。
1. 业务背景与核心需求拆解
1.1 货拉拉营销广告的典型场景
货拉拉的营销广告体系,和大家熟悉的电商或者本地生活平台有相似之处,但也有很明显的差异化特征。我们面对的用户群体基本可以分为三类:C端用户(发单叫车的人)、B端商家(有固定货运需求的商户)、司机师傅(平台的运力供给方)。这三类人群在不同的周期里有完全不同的营销诉求,比如新用户拉新、老用户促活、流失用户召回、司机招募、商家续费提醒等等。
广告形态上,我们覆盖的渠道也比较杂。信息流广告(抖音、快手、腾讯系)、搜索广告(百度、小红书)、厂商渠道(OPPO、vivo、华为)、自有渠道(App Push、短信、站内banner)。每一类渠道对文案的字数、风格、合规要求都不一样,一个素材要适配这么多渠道,过去基本靠人工改,改一轮下来半天就没了。
更麻烦的是,货拉拉的营销有极强的时效性和地域性。比如同城货运的下单高峰集中在上午,周末和节假日的需求波动又完全不同。碰上大促或者恶劣天气,我们可能需要短时间内在不同城市投放几百组差异化的广告文案。这种规模的产出,用传统的人工方式来搞,几乎是不可能的。
1.2 大模型切入的角色与价值
大模型在这个场景里切入的核心角色,不是替代人的决策,而是做产能的放大器。决策还要人来定,但大模型可以把之前 3 个人干一周的活,压缩到 1 个人干一天。这个价值在营销领域是立竿见影的,因为广告物料本质上就是“结构化的文本+创意组合”,这是大模型的强项。
在我们实际梳理之后,大模型能切入的环节大致有四个方向:
- 广告文案生成:包括信息流标题、落地页文案、短信文案、Push文案,通过批量生成+人工挑选,大幅提升素材产出量。
- 创意素材扩展:基于同一套卖点,生成不同风格、不同侧重点的文本变体,配合后续的多模态模型做图片甚至视频素材的生产。
- 用户理解辅助:结合大模型对用户评论、客服对话、搜索词等非结构化文本的分析,产出人群标签和投放策略建议。
- 投放复盘辅助:把广告投放的数据表现喂给大模型,让它辅助整理归因结论,甚至产出下一步投放计划的初稿。
这里面绝大部分工作不需要微调一个什么“营销大模型”,基于现有开源模型的能力,配合工程化的提示词设计和检索增强,已经能覆盖大部分需求。这也是我特别想强调的一点:大模型落地应用,99%的场景不需要重新训练模型,你真正需要的是把业务流程想清楚。
2. 技术选型与架构设计
2.1 基座模型与部署方式选择
我们在技术选型时,第一件事就是确定用哪类模型做底座。市面上的大模型多如牛毛,国内外的开源闭源模型都有各自的优势。但企业级应用必须考虑三个因素:数据隐私合规、可定制性、成本。
货拉拉的营销数据属于业务核心数据,肯定不能直接送到外部模型处理,比如把用户手机号、订单信息这种敏感数据拼进提示词里发给外部API,这种方案在风控那里就过不去。所以我们的思路是两条腿走路:
- 线上实时场景(比如用户点击广告后的落地页商品推荐):用企业内部私有化部署的开源模型,例如基于Qwen系列或者LLaMA系列的中文优化模型,确保数据不出内网。
- 非实时批量场景(比如生成几百组文案草稿):可以调用外部大模型API,但必须先做脱敏处理,把用户ID、手机号替换成虚拟标识。
部署方式上,我们采用了类似于Ollama和vLLM的组合方案。早期验证阶段用Ollama在单卡GPU上快速跑通业务逻辑,验证完提示词流程后,再迁移到vLLM做多卡并发推理,解决线上服务的吞吐问题。vLLM的PagedAttention机制对长文本生成的显存管理确实比原生方案好很多,实测文本生成类的请求吞吐能提升好几倍。
2.2 广告场景的链路架构
大模型在营销广告场景的完整链路,我从工程角度拆解为四层:
第一层是“业务策略层”。这一层由运营和市场同学定义,比如“这次活动的目标是拉新还是促活”“主打卖点是价格低还是速度快”“目标城市是哪些”。这些信息被结构化后,作为大模型生成的约束条件。
第二层是“内容生产层”。大模型根据约束条件生成初稿,然后通过风格模板、润色规则、合规过滤来产出多版本候选。这一步是典型的“提示词工程+后处理”的组合。
第三层是“审核管理平台”。所有大模型产出的内容,在正式投放前必须经过人工审核和系统过滤。我们会用一些规则模型做敏感词合规过滤,再用人工抽检兜底,确保生成内容没有政治风险、没有违规宣传、没有事实性错误。
第四层是“投放反馈层”。广告投出去后,点击率、转化率、素材生命周期等数据回流到数据平台,形成投放效果报告,再反哺到大模型的提示词优化中。这个闭环是整个系统最值钱的部分,它让大模型不是一次性工具,而是越用越准的投放助手。
3. 核心实践:广告文案生成与创意生产
3.1 提示词工程与上下文工程
这套系统的第一步,也是最关键的一步,就是广告文案的提示词设计。很多团队刚开始接触大模型提示词的时候,容易把人当模型用,写一句“帮我写个广告文案”就完事了。实际跑下来效果很不稳定,因为模型缺乏对货拉拉业务的理解,也不知道文案要投放到什么渠道。
我们花了大量精力在提示词的结构化上。一个标准文案生成任务的提示词大致包含五个部分:
- 角色设定:你是一位拥有10年货运行业经验的营销文案专家,熟悉货拉拉的同城货运、跨城货运、跑腿代买等业务。
- 任务描述:请根据以下产品卖点和活动信息,生成一条信息流广告文案。
- 背景信息:包括目标用户人群(比如搬家用户、小商户、司机)、投放渠道(抖音信息流)、字数限制(15-25字)、投放时段等。
- 风格约束:要求文案口语化、无标点或极少标点、突出价格优势、不使用夸张词汇。
- 输出格式:每次输出5个备选文案,每个文案用编号列出,并附上一句话说明该文案的侧重点。
这个结构看起来简单,但实际迭代优化的过程中,我们发现“背景信息”这部分权重非常高。同样的一个活动,面向“需要搬家的C端用户”和面向“有高频送货需求的B端商家”,文案完全是两种写法。所以我们会把用户画像、活动利益点、渠道特征等维度的内容,用程序化方式拼接到提示词里,而不是让运营同学手写。
上下文工程也是我们后面才补齐的一环。最初我们用大模型生成文案时,每来一个请求就调一次模型,模型没有任何“记忆”,对同一批产品的文案风格也无法保持一致。后来我们在服务层做了会话缓存,把同一批任务的历史生成结果作为上下文回传,模型生成的文案风格稳定性明显提升。这就是“上下文工程”的价值:不是只优化单次生成,而是管理模型在整个任务周期内的一致性。
3.2 基于业务数据的微调尝试
提示词工程能解决80%的通用场景,但到了品牌调性非常强的项目上,我们还是尝试了微调路线。物料这块我们做了几次实验,最典型的是对Qwen2.5-7B模型做了营销文案风格的微调。
微调用的数据来自我们历史投放中表现良好的文案,加上人工润色过的优秀案例,大概几千条。数据格式很简单:输入是业务背景描述(卖点、受众、渠道),输出是成稿文案。用LoRA这种低秩适配的方式只训练适配器层,成本可控,一张A100级别的显卡就能跑。
这里穿插一个实操细节。微调之前,一定要把训练数据做清洗和格式统一。我们第一次微调时,直接拿历史投放文案喂进去,结果模型学到的不是文案风格,而是历史文案里各种繁体字、错别字、标点混乱的坏习惯。后来我们做了比较严格的清洗:繁体转简体、全角转半角、去除非正文信息、统一标点风格,效果才算真正出来。
说实话,微调这件事性价比是分场景的。如果只是短平快的活动物料,提示词足够用了,没必要上微调。但如果是持续投放的品牌战役、月度固定的营销日历,每次生成都需要保持稳定风格的时候,微调的优势才明显。我的建议是:先用提示词验证业务价值,再决定是否值得投入微调资源。
3.3 素材生成与多模态扩展
文本文案只是第一步。信息流广告还需要配图、配视频脚本、配落地页内容。我们在大模型应用的第二阶段,把多模态能力引了进来。
广告配图这块,我们用的是多模态大模型的文生图能力,根据文案的主题生成几个版本的创意方向,再由设计师在生成稿的基础上做精修。坦白说,完全AI生成的图片直接用于商业投放,质量还是不太够,尤其是画面里出现品牌Logo、真人形象、车辆外观这些元素时,细节会有偏差。但把它当作“创意的起稿器”,给设计师提供构图灵感和方向参考,这个价值是实实在在的。
视频素材方面,我们做的是脚本生成。大模型根据活动主题生成短视频的脚本框架,包括场景描述、台词对白、镜头切换建议。然后由拍摄团队按脚本执行。实测下来,以前拍一条15秒的短视频,从构思到脚本定稿要两三天,现在大模型生成初稿加人工修改,半天就能搞定。
多模态扩展这块我们还在探索,但已经能看到一个趋势:未来的广告物料是“文本、图片、视频、落地页”四位一体生成,大模型在这里面扮演的是中央创意引擎。货拉拉的物料体系也在往这个方向调整。
4. 用户理解与精准投放
4.1 用户画像与大模型理解
广告投放最终要看转化,而转化好不好,很大程度上取决于你对用户的理解够不够深。货拉拉的App里沉淀了大量用户行为数据和文本数据,比如用户可能在下单前咨询“能不能帮我搬一个床垫”“有没有面包车可以拉货”,这些对话文本里藏着非常真实的用户意图。
传统的人群标签体系依赖规则和关键词,比如用户搜了“搬床垫”就给他打一个“搬家需求”的标签。这种做法的缺点是规则太死,覆盖不了复杂场景。而大模型出现后,我们开始用“大模型+知识抽取”的方式做意图识别。把用户的历史搜索、客服会话、浏览行为转成文本序列,输入大模型,让它输出对用户需求的理解和标签建议,再配合传统标签系统做融合。
举例来说,一个用户可能什么都没搜,只在一个“大件搬运价格”的落地页停留了很久,传统系统只能捕捉到“访问过落地页”这个行为事实。但大模型能结合上下文推理出:该用户正在计划搬家、对价格敏感、可能居住在没有电梯的老小区、需要大型车辆。这些推理结论直接决定了投放给他什么文案、出多少价、应该推哪种车型。这在过去是完全做不到的。
4.2 智能投放策略与自动化试验
投放策略层面,我们做了一个“策略助手”的工具。本质上是把大模型的生成能力和规则引擎结合在一起:每天早晨,策略助手根据前一天的投放数据,生成当日的投放建议,包括哪些城市、哪些人群、哪些文案组合值得加预算,哪些素材已经衰退需要替换。
这个工具的输入是一份自动生成的数据摘要,内容包含各渠道消耗、点击率、转化成本等核心指标。大模型的任务不是预测数值,而是解读数据背后的业务含义,并给出调整动作建议。比如数据摘要里显示“成都地区素材点击率一周内下降了20%”,大模型会结合上下文建议“成都地区文案复用次数过高,建议启用新生成的针对本地用户的搬迁场景文案”。
这类辅助决策工具的价值不是替代优化师,而是给优化师省下大量整理数据和写报告的时间。优化师可以把精力集中在真正需要人为判断的事情上,比如预算分配的大方向调整、异常流量的排查等。
我们还顺手做了一套自动化A/B测试工具。以前做文案A/B测试,需要人工创建多个测试组、手动分配流量、最后靠Excel做显著性检验。现在大模型生成候选文案后,系统自动完成分组创建、流量分配、数据回收和报告生成,整个流程走下来,实验启动时间从两天缩到两小时。
5. 质量保障与效果评估
5.1 内容审核与安全防线
大模型生成内容用得越多,越要重视内容安全问题。广告文案一旦审核不严,轻则被渠道拒审,重则带来合规风险,这是所有做营销技术的人都必须警惕的。
我们搭了三级过滤机制。第一级是规则过滤,用敏感词库和正则表达式对生成文案做初筛,把明显的违规词、夸大词(比如“最便宜”“100%保证”)直接过滤掉。第二级是模型安全过滤,利用专门的文本审核模型对文案做进一步的语义风险判定,执行广告法合规性检查,比如识别“绝对化用语”“诱导消费表述”等。第三级是人工抽检,运营同学按比例对生成内容做审核,同时被渠道拒审的文案会自动回流到样本库,反哺优化过滤规则。
这套流程里最容易忽视的是“幻觉问题”。大模型生成文案时,可能会编造出不存在的优惠信息、虚构的品牌资质、算错的折扣数字。我们的对策是在提示词里强制加入“可使用信息字段”,比如把活动折扣、活动时间、适用城市从数据库查出来,直接填入提示词的约束层,同时规定“不得表述以上信息字段之外的数据”。这一步能把幻觉问题压到最低。
5.2 效果评估指标体系
大模型生成的广告文案,到底好不好?这事不能靠感觉,必须靠数据说话。我们的效果评估分两个层次:
第一层是生成质量的即时评估。在文案生成后、投放之前,用一套自动评估逻辑做初步打分,包括字数合规性、是否包含必要卖点、是否包含合规品牌词、句子的通顺程度和风格匹配度。这一层是机器做的事情,用来筛掉明显的低级错误。
第二层是投放效果的因果评估。这个更复杂,因为我们投的每个渠道、每个人群的环境都不同,很难直接比较两个文案谁好谁坏。我们引入了相对增益的概念,就是把新生成的素材和同周期、同渠道、相似人群的老素材放在一起,比较点击率和转化率的相对变化,结合置信区间来判断新素材是否有显著的投放优势。这套方法比单看转化成本峰值更科学,也更能体现大模型素材在不同人群、地域中的真实表现。
经过几轮迭代,现在团队内部已经形成共识:大模型生成的素材不是拿来就用,而是拿来“跑”。让每个素材去市场上跑真金白银的实验,数据好的加大投放,数据差的自动淘汰。大模型的作用是把候选池做大,让实验跑得更快、更多。
6. 踩坑实录与优化心得
6.1 常见问题与排查技巧
这里整理一下我们在实际部署和日常使用中遇到过的问题,希望能帮大家少踩一些坑。
第一个坑是并发服务的性能瓶颈。早期我们直接用本地部署的模型服务接收所有文案生成请求,结果一到运营集中提需求的时候,服务就会超时甚至卡死。排查后发现瓶颈在推理服务的批量调度上。后来切换到vLLM并开启Continuous Batching,同时把服务拆分成“实时生成”和“批量生成”两个独立队列,才彻底解决。
第二个坑是提示词模板的“水土不服”。同一个提示词模板在不同模型上的表现差别极大,有些大模型对格式不敏感,有些则会被模板中的大量指令带偏。我们维护了一个提示词版本管理表,每次切换基座模型时都重新跑一遍测试集,对比输出质量,再决定是调整模板还是选择其他适配模型。
第三个坑是格式解析的稳定性。大模型输出的文案经常会出现多余的空行、编号格式错乱、多余的解释性文字。我们用规则加正则做了后处理,同时在提示词末尾强制声明“只输出文案内容,不要输出任何其他解释文字”,还不行就再加一个解析修复层,把生成的脏数据清洗成结构化的JSON格式再进入审核流程。
第四个坑是数据回流。做投放复盘时,大模型分析的数据如果本身有缺失,分析结论就会带偏。比如某个渠道的转化数据因为SDK故障缺失了两天,模型不知道这事,就会得出“该渠道效果持续下降”的错误结论。我们在数据输入前增加了一层数据质量标记,把缺失、采样不完整的数据列自动标注,提示模型在分析时规避这些数据段,避免误导决策。
6.2 经验总结:大模型进入业务的最佳姿势
整个项目做下来,我个人最大的体会有三点。
第一点,大模型在营销广告的落地,最大的价值不在“生成一篇文章”,而在“批量生产高质量候选”。人写文案是精品路线,模型跑文案是走量路线。走量意味着你可以用更低的成本做更多的实验,用实验数据反哺策略,这套打法才是大模型给营销带来效率跃迁的根本原因。
第二点,不要一上来就想着训练自己的模型。微调是一个很好用的工具,但它不是你在业务验证阶段的必需品。先用成熟开源模型加提示词工程把流程跑通,让业务同学感受到效率的提升,拿到阶段性成果,再考虑要不要投入微调。这个顺序不能反,反了就是成本黑洞。
第三点,一定要把人工审核保留在链路里。不管大模型多强大,机器生成的营销内容在企业里最终还是要人来把关。这套系统能不能走得长远,取决于人和机器怎么分工:机器负责海量生成和初筛,人负责关键决策和异常处理。我们把更多的人力投入到审核、创意策略等高价值环节,而不是素材轮转的低效劳动上,整个营销团队的工作方式也因此在慢慢改变。
现在这个大模型营销广告应用系统已经在货拉拉的多个业务线持续运行,文案生成产能比初期提升数倍,营销团队的创造力也被更大限度地释放了。从最开始用提示词写几段文案的简单实验,到现在逐步融入投放策略和用户理解的完整链路,我个人觉得,这大概是“大模型需要落到具体场景里才能真正发挥价值”这句话最好的一个注解。