定义任务
确定输入、输出、评价标准和不可接受的失败。模型不会替项目定义价值。
HOW AI SYSTEMS WORK
理解大模型不能只看神经网络。一个可用的 AI 产品还包括数据、提示、检索、工具、权限、评估、监控和人工接管。
THE FULL PIPELINE
任何一个环节失效,最后的回答都可能出问题。
确定输入、输出、评价标准和不可接受的失败。模型不会替项目定义价值。
收集、清洗、去重、标注、分词或转换数据,同时处理许可、隐私和代表性。
结构决定信息如何流动。语言模型常以 Transformer 作为核心架构。
模型预测、计算损失、反向传播并更新参数,经过大量迭代学习统计模式。
通过指令数据、反馈、规则、微调或提示,使通用能力适合真实交互与任务。
输入被转为 token,模型逐步计算下一个 token 的概率,再按策略生成输出。
用 RAG 获取外部资料,用函数调用执行搜索、计算、数据库或业务动作。
测量质量、错误类型、成本、延迟、安全和用户结果,并在变化后持续回归测试。
INSIDE A LANGUAGE MODEL
它的训练目标看似简单:预测下一个 token。但规模、数据和上下文让这种预测形成广泛能力。
训练语料中包含大量语言结构、知识关联和任务示例。模型学习的是条件概率与内部表示,不是简单拼接句子。
生成目标首先是产生在上下文中“可能”的序列,而不是自动验证每句话。流畅性和真实性是两个不同目标。
提示改变了当前条件:任务、材料、角色、限制和示例都会改变后续 token 的概率分布。
MODEL → APPLICATION
成本最低、迭代最快。适合模型已有能力,只需明确任务和格式的情况。
解决:任务表达与输出契约先从可信资料中召回内容,再回答并引用。适合知识更新和私有文档。
解决:知识来源与可追溯性用高质量示例调整行为、风格或专门任务表现,不适合频繁更新事实。
解决:稳定行为与专门模式把目标拆成步骤并使用外部工具。能力最强,但失败面、权限和成本也更复杂。
解决:多步骤行动与系统协作RAG UNDER THE HOOD