HOW AI SYSTEMS WORK

从数据到回答:模型只是完整系统的一部分

理解大模型不能只看神经网络。一个可用的 AI 产品还包括数据、提示、检索、工具、权限、评估、监控和人工接管。

模型原理 · RAG · 智能体 · 评估

THE FULL PIPELINE

一套 AI 系统的八个环节

任何一个环节失效,最后的回答都可能出问题。

01

定义任务

确定输入、输出、评价标准和不可接受的失败。模型不会替项目定义价值。

02

获得与处理数据

收集、清洗、去重、标注、分词或转换数据,同时处理许可、隐私和代表性。

03

选择模型结构

结构决定信息如何流动。语言模型常以 Transformer 作为核心架构。

04

训练参数

模型预测、计算损失、反向传播并更新参数,经过大量迭代学习统计模式。

05

对齐与适配

通过指令数据、反馈、规则、微调或提示,使通用能力适合真实交互与任务。

06

推理与采样

输入被转为 token,模型逐步计算下一个 token 的概率,再按策略生成输出。

07

连接知识与工具

用 RAG 获取外部资料,用函数调用执行搜索、计算、数据库或业务动作。

08

评估与监控

测量质量、错误类型、成本、延迟、安全和用户结果,并在变化后持续回归测试。

INSIDE A LANGUAGE MODEL

大语言模型最核心的预测循环

它的训练目标看似简单:预测下一个 token。但规模、数据和上下文让这种预测形成广泛能力。

输入“人工智能可以帮助”
分词[人工] [智能] [可以] [帮助]
上下文化表示Embedding + Attention
概率分布研究 .31 · 人们 .24 · 完成 .18

为什么能写得流畅?

训练语料中包含大量语言结构、知识关联和任务示例。模型学习的是条件概率与内部表示,不是简单拼接句子。

为什么会一本正经地出错?

生成目标首先是产生在上下文中“可能”的序列,而不是自动验证每句话。流畅性和真实性是两个不同目标。

为什么提示有作用?

提示改变了当前条件:任务、材料、角色、限制和示例都会改变后续 token 的概率分布。

MODEL → APPLICATION

四种常见的应用增强方式

Prompt

提示与结构化输出

成本最低、迭代最快。适合模型已有能力,只需明确任务和格式的情况。

解决:任务表达与输出契约
RAG

检索增强生成

先从可信资料中召回内容,再回答并引用。适合知识更新和私有文档。

解决:知识来源与可追溯性
Fine-tuning

微调与行为适配

用高质量示例调整行为、风格或专门任务表现,不适合频繁更新事实。

解决:稳定行为与专门模式
Agent

工具调用与智能体

把目标拆成步骤并使用外部工具。能力最强,但失败面、权限和成本也更复杂。

解决:多步骤行动与系统协作

RAG UNDER THE HOOD

知识库问答为什么也会答错?

文档切分向量化召回候选重排组装上下文生成与引用
失败位置典型表现改进方向
切分关键定义被拆开按语义与文档结构切分
召回找不到真正相关材料混合检索、查询改写、扩大候选
重排相关但不支持结论使用更强重排与证据规则
生成超出材料推断引用约束、拒答与逐句验证
下一章 · 术语系统理解 28 个关键概念