news 2026/7/24 12:21:01

通用 AI 基础认知

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
通用 AI 基础认知

大语言模型基础核心概念

1. Token(令牌)

1.定义

  • 中文:1 个汉字≈2 个 Token;
  • 英文:1 个短单词≈1 个 Token,长单词会被拆分;
  • 符号、数字、空格单独占 Token。

2.关键作用(后端重点)

  • 上下文窗口由 Token 限制:比如模型 8K、32K、128K,代表单次输入 + 输出总 Token 上限;
  • 计费标准:所有云厂商大模型按输入 Token、输出 Token 分开收费;
  • RAG 知识库切片、历史会话存储都要控制 Token,超长文本会截断丢失信息。
    3.开发痛点
  • 会话历史过长、知识库一次性灌入海量文本会触发截断机制,问答丢失上下文信息,后端必须做 Token 计数、文本截断工具。

2. Context Window(上下文窗口)

1.含义

  • 模型单次对话能记住的全部文本总 Token 容量,包含:系统提示词 + 用户历史问答 + 当前提问 + 模型返回内容。
    2.分类
  • 小窗口:4K/8K,适合简单单次问答;
  • 大窗口:32K/128K/1M,适合长文档解读、完整知识库对话、长代码分析。
    3.后端工程意义
    做 AI 会话模块必须实现窗口滑动清理:超出 Token 上限时自动丢弃最早的历史对话,否则接口直接报错、问答失效。

3. Hallucination(幻觉)

1.定义

  • 大模型无依据编造不存在的内容、接口、表字段、文档数据、SQL 语句,看似逻辑通顺,但完全虚假。

2.常见场景(后端高频踩坑)

  • 让 AI 查数据库,编造不存在的表名、字段;
  • 解读内部业务文档,虚构文档中未定义的规则;
  • 生成第三方 API,编造不存在的请求参数;
  • RAG 检索不到内容时,凭空编造知识库信息。

3.后端解决方案

  • 强制开启引用溯源:要求 AI 回答必须附带检索文档片段;
  • 提示词约束:无匹配资料直接回复 “暂无相关信息”,禁止编造;
  • 校验层:AI 生成的 SQL、接口代码、数据统一二次校验再执行。

4. Temperature(温度-生成随机性参数)

1.取值范围 0~1

  • 越接近 0:输出稳定、固定、重复度低,适合代码生成、数据查询、结构化 JSON 输出(后端业务首选 0.1~0.3);
  • 越接近 1:创意高、随机性强,适合文案、聊天、创意内容,不适合业务系统。

2.后端开发规范

  • 企业 AI 中台统一默认温度 0.2,仅开放配置入口给前端运营,禁止随意调高,防止返回结果不稳定。

5. Top-P(核采样)

  • 配合 Temperature 控制输出多样性,一般和温度二选一调节,后端业务场景固定 0.1 即可,无需动态调整。

Embedding 向量化(RAG、知识库核心)

1. 什么是 Embedding(嵌入向量)

将文字、句子、文档,通过专门的向量模型转换成一串浮点数字数组(向量),文本语义越相似,两组向量数字距离越近。

  • 文字本身计算机无法计算相似度;向量可以通过数学公式快速对比语义。

2. 向量维度

不同向量模型输出维度不同:512 维、768 维、1024 维、1536 维,维度越高语义表达越精准,存储、检索开销越大。

3. 相似度计算方式(后端必须懂)

1.余弦相似度 Cosine:最常用,适合文本语义匹配,向量库默认算法;
2.欧氏距离、点积:少量向量库场景使用。

4. 两类模型区分(后端选型关键)

1.大语言模型(Chat 模型):负责对话、总结、逻辑推理、代码生成;
2.Embedding 向量模型:只做文本转向量,不具备对话能力,专门用于知识库检索。

5. 后端落地要点

  • 知识库文档必须分段后再向量化,整份长文档向量语义混杂,检索精度极差;
  • 向量持久化存入向量数据库,不能每次问答实时生成向量(性能差、耗钱);
  • 新增 / 删除文档需要同步新增 / 删除对应向量,保证数据一致性。

RAG 检索增强生成(企业 AI 系统标配)

1. RAG 完整定义

Retrieval-Augmented Generation,检索增强生成。解决大模型两大痛点:
1.模型知识有时间截止,无法读取企业私有文档、实时业务数据;
2.容易产生幻觉,回答脱离企业内部资料。

2. 标准完整执行链路(后端 SpringAI 开发核心流程)

1.文档加载:读取 PDF、Word、Markdown、数据库业务数据;
2.文本切分(切片):长文档拆分成固定长度文本块,设置重叠片段保证上下文连贯;
3.Embedding 向量化:文本块调用向量模型生成向量;
4.向量入库:文本块原文 + 向量存入向量数据库;
5.用户提问:用户输入问题,同样生成问题向量;
6.相似度检索:在向量库匹配 Top-N 最相似的文档片段;
7.拼接 Prompt:把检索到的真实企业资料 + 用户问题 + 系统指令合并发给大模型;
8.模型生成回答:AI 基于检索到的真实资料作答,大幅减少幻觉。

3. RAG 核心优势(业务价值)

  • 不用微调大模型,低成本接入企业私有知识库;
  • 知识可实时更新,新增文档立刻生效;
  • 可控性强,回答来源可追溯,适合客服、内部资料问答、业务查询。

4. 后端常见优化点

  • 切片大小调优、重叠值配置、多路召回、重排序、过滤无关检索片段、Token 压缩。

Function Calling 函数调用(AI 对接后端业务接口核心)

1. 定义

大模型识别用户需求后,主动调用后端预先定义好的接口 / 工具函数,获取实时业务数据,再整合数据回复用户。示例场景:用户问 “本月订单总额”→AI 识别需要调用订单微服务接口→后端执行 SQL 查询→把订单数据传给 AI→AI 整理数字回答用户。

2. 完整流程

1.后端向模型注册工具:定义函数名称、功能描述、入参结构、数据类型;
2.用户提问传入模型;
3.模型判断是否需要调用工具:

  • 不需要:直接生成文字回答;
  • 需要:返回结构化 JSON,包含调用函数名、所需参数;
    4.后端解析 JSON,本地执行对应业务接口;
    5.将接口返回数据回传给大模型;
    6.模型结合实时业务数据生成最终自然语言答复。

3. 后端开发价值

打通 AI 和现有微服务体系,让 AI 具备查询数据库、操作业务系统、调用第三方服务的能力,是智能中台必备能力。

4. 安全风险(后端重点管控)

  • 必须做参数校验、权限拦截,防止 AI 越权查询数据;
  • 禁止 AI 直接拼接 SQL 执行,杜绝注入风险;
  • 工具调用日志全量留存,方便审计。

Prompt 提示词工程(所有人必备软实力)

1. 什么是 Prompt

发给大模型的全部指令文本,包含角色、规则、任务、输入数据、输出约束,直接决定 AI 输出质量

2. 标准结构化 Prompt 万能模板(后端业务通用)

【角色】你是企业后端智能助手,严谨、只基于提供资料回答,禁止编造内容
【任务】根据下方参考文档回答用户问题
【约束规则】

  1. 无匹配资料直接回复:暂无相关资料,不要捏造信息
  2. 回答输出JSON格式,包含answer、source(文档来源)两个字段
  3. 禁止输出多余解释、 markdown格式

【参考资料】 {rag检索到的文档片段}
【用户问题】 {用户输入}

3. 三大 Prompt 技术

1.Zero-shot 零样本:只给任务,不给示例,简单场景使用;
2.Few-shot 少样本:指令中附带 2~3 条输入输出示例,大幅提升结构化输出准确率(后端生成 JSON、SQL 必用);
3.思维链 CoT:引导 AI 分步思考,复杂计算、多条件业务查询时使用,减少逻辑错误。
4.后端系统级 Prompt 设计规范

  • 系统提示词(System Prompt):全局固定,定义 AI 身份、全局规则、输出格式,永久携带;
  • 动态提示变量:RAG 检索内容、用户问题、会话历史动态填充;
  • 统一封装 PromptTemplate 工具类(SpringAI 原生支持),统一管理所有业务提示词,便于运营修改、版本管理。

5.提示词注入漏洞(安全重点)
恶意用户输入特殊字符、指令覆盖系统预设规则,诱导 AI 泄露数据、执行危险逻辑。防护方案:后端统一转义用户输入、隔离用户输入与系统指令区块、关键词过滤。

主流模型分类与选型区分(后端做中台必备)

1. 对话大模型(LLM)

通义千问、文心一言、GPT 系列、Llama、Qwen 本地模型,负责问答、总结、推理、FunctionCall、代码生成。

2. 向量 Embedding 模型

text-embedding、通义向量、bge 系列,只用于文本向量化、知识库检索,无对话能力。

3. 代码专用模型

CodeLlama、CodeQwen,代码补全、bug 修复、生成 Java/SQL,比通用模型准确率更高。

4. 多模态模型

支持图片 + 文本输入,文生图、图片解析、截图代码识别,业务系统如单据 OCR、图片解读。

选型判断标准(后端中台设计参考)

1.仅知识库问答:对话 LLM + Embedding 向量模型;
2.需要读取图片单据:多模态大模型;
3.私有化本地部署:开源 Qwen/Llama/Ollama;
4.代码生成场景:专用代码模型。

AI 会话管理基础概念

1.会话 Session:单个用户一次完整对话链路,独立存储历史问答;
2.会话持久化:历史问答存入 Redis/MySQL,重启服务不丢失对话;
3.多租户隔离:不同业务线、不同客户会话数据完全隔离;
4.自动过期清理:长期不活跃会话清理,释放 Token 占用、节省存储;
5.历史压缩:超长历史自动摘要压缩,降低 Token 消耗。

AI 生产环境基础风险认知(后端必须掌握)

1.幻觉风险:输出虚假业务数据;
2.提示词注入:安全漏洞;
3.敏感数据泄露:客户隐私、数据库明文传入模型;
4.调用超限 / 扣费失控:无限流时大量请求高额计费;
5.模型接口超时、熔断:第三方大模型服务不稳定,需要重试、降级策略。

该部分知识对后端程序员的实际价值总结

1.看懂 SpringAI 底层执行逻辑,能独立开发 RAG、FunctionCall、统一 AI 网关;
2.能合理选型模型、向量库,评估接口性能与成本;
3.能预判各类线上问题(截断、幻觉、会话溢出、注入攻击)并给出解决方案;
4.看懂 AI 产品需求,和算法、产品无障碍沟通;
5.设计规范、可维护、安全可靠的企业 AI 微服务中台。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/24 12:19:22

Token这门生意,数字不会说谎

Token这门生意,数字不会说谎 不做推荐,不谈产品,只看数据。以下所有数字均来自公开报告和行业数据。 一张图看懂Token经济的体量 先说几个数字,感受一下这个赛道有多大: 中国日均Token调用量:140万亿。两…

作者头像 李华
网站建设 2026/7/24 12:18:47

U++ SpawnActor

StaticClass()获取类基本用法:UClass* MyClass AMyActor::StaticClass();此时没有生成任何Actor,只是获取了AMyActor这个类型,其中UClass* 储存类信息。StaticClass告诉函数,需要处理哪一种类。例如,查找场景中的所有…

作者头像 李华
网站建设 2026/7/24 12:16:00

智能优化算法与深度学习在轴承故障诊断中的应用

1. 项目背景与核心价值轴承作为旋转机械的核心部件,其健康状态直接影响设备运行安全。传统振动信号分析方法依赖人工特征提取,存在效率低、泛化性差的问题。本项目提出了一种融合智能优化算法与深度学习的端到端诊断框架,实现了从原始振动信号…

作者头像 李华
网站建设 2026/7/24 12:12:56

162.2026年国家级科研瓶颈:高精度滚珠丝杠预紧力与热伸长补偿

2026年国家级科研瓶颈:高精度滚珠丝杠预紧力与热伸长补偿 高精度滚珠丝杠的预紧力与热伸长补偿,长期卡在一个“预紧力调高→刚度上升→摩擦发热加剧→热伸长失控→被迫降低预紧→刚度下降”的死循环里。预紧力决定了轴向刚度和传动精度,但预紧…

作者头像 李华
网站建设 2026/7/24 12:12:24

深入解析LM3559 LED驱动芯片的电压监控与闪光超时保护机制

1. 项目概述与核心价值在便携式电子设备,尤其是智能手机的相机闪光灯和手电筒应用中,LED驱动芯片的稳定性和安全性是决定用户体验与产品可靠性的关键。一个看似简单的“点亮LED”动作,背后却隐藏着复杂的电源管理逻辑。想象一下,当…

作者头像 李华
网站建设 2026/7/24 12:11:51

基于YOLOv5的实时口罩检测系统设计与优化

1. 项目背景与核心价值2020年全球公共卫生事件后,公共场所的口罩佩戴检测成为刚需。传统人工巡查方式效率低下且容易遗漏,而基于计算机视觉的自动化检测方案开始在各场景落地。这个毕业设计项目正是瞄准这一实际需求,采用当前最前沿的深度学习…

作者头像 李华