2023—2026 大模型发展史:100篇技术与学习教程写作计划
这不是单纯的新闻年表,而是一条可以真正动手的学习路线:先理解 Transformer 和训练,再做推理、RAG、微调、评测、智能体和生产部署。表中的“建议发布时间”覆盖 2023 年 1 月至 2026 年 8 月,按每年 25 篇组织;日期可根据实际写作进度微调。
2023:从 ChatGPT 到 LLM 应用原型
这一年适合讲清基础模型为什么有效,以及普通开发者怎样第一次把模型接进应用。
| 编号 | 建议发布时间 | 题目 | 形式 |
|---|---|---|---|
| 001 | 2023-01-08 | ChatGPT 爆发的技术背景:从 GPT-3.5 到对话模型 | 发展史 |
| 002 | 2023-01-22 | Transformer 架构入门:Self-Attention 到底在算什么 | 原理教程 |
| 003 | 2023-02-05 | Token、词表与 BPE:模型如何阅读一段中文 | 原理教程 |
| 004 | 2023-02-19 | 位置编码:模型为什么需要知道词语顺序 | 原理教程 |
| 005 | 2023-03-05 | GPT 的 Decoder-only 结构与自回归生成 | 原理教程 |
| 006 | 2023-03-19 | 预训练、指令微调与 RLHF 的完整链路 | 原理教程 |
| 007 | 2023-04-02 | 从零调用大模型 API:请求、流式输出与错误处理 | 实战教程 |
| 008 | 2023-04-16 | Prompt Engineering 的基本方法与反模式 | 实战教程 |
| 009 | 2023-04-30 | System、User、Assistant 消息的职责边界 | 实战教程 |
| 010 | 2023-05-14 | Function Calling:让模型可靠地调用天气接口 | 实战教程 |
| 011 | 2023-05-28 | JSON Mode 与结构化输出校验 | 实战教程 |
| 012 | 2023-06-11 | 流式响应的前后端实现:SSE 与增量渲染 | 实战教程 |
| 013 | 2023-06-25 | 对话记忆:上下文窗口、摘要与持久化 | 架构教程 |
| 014 | 2023-07-09 | Embedding 是什么:把文本变成可检索的向量 | 原理教程 |
| 015 | 2023-07-23 | 向量数据库入门:相似度、索引与召回 | 实战教程 |
| 016 | 2023-08-06 | RAG 最小实现:给博客接入知识库问答 | 实战教程 |
| 017 | 2023-08-20 | RAG 为什么会答错:切分、召回与上下文噪声 | 原理教程 |
| 018 | 2023-09-03 | LangChain 的核心抽象:Model、Prompt、Chain | 框架教程 |
| 019 | 2023-09-17 | LlamaIndex 文档索引与检索流程 | 框架教程 |
| 020 | 2023-10-01 | 开源模型的本地运行:量化、显存与 Ollama | 部署教程 |
| 021 | 2023-10-15 | LLaMA 系列模型:开源权重带来的生态变化 | 发展史 |
| 022 | 2023-10-29 | Hugging Face Transformers 快速上手 | 实战教程 |
| 023 | 2023-11-12 | 生成参数:temperature、top-p 与重复惩罚 | 原理教程 |
| 024 | 2023-11-26 | LLM 应用的第一套评测:准确率、延迟与成本 | 工程实践 |
| 025 | 2023-12-10 | 从 Demo 到产品:2023 年 LLM 应用的通用架构 | 总结教程 |
2024:多模态、长上下文与应用工程化
2024 年的主线是“模型能力开始进入工程系统”:视觉输入、长上下文、工具使用和可观测性都需要落到代码里。
| 编号 | 建议发布时间 | 题目 | 形式 |
|---|---|---|---|
| 026 | 2024-01-07 | GPT-4o 的意义:文本、图像、音频统一交互 | 发展史 |
| 027 | 2024-01-21 | 多模态模型入门:图像如何进入 Transformer | 原理教程 |
| 028 | 2024-02-04 | Vision-Language Model 的图像问答实战 | 实战教程 |
| 029 | 2024-02-18 | Whisper 语音识别:从音频到文本 | 实战教程 |
| 030 | 2024-03-03 | 文本转语音与实时语音对话 | 实战教程 |
| 031 | 2024-03-17 | Gemini 1.5 与长上下文:长不等于记得住 | 发展史 |
| 032 | 2024-03-31 | Context Window 的内存模型与成本计算 | 原理教程 |
| 033 | 2024-04-14 | 长文档问答:Map-Reduce、Refine 与分层摘要 | 架构教程 |
| 034 | 2024-04-28 | Claude 3 系列与模型能力评测方法 | 发展史 |
| 035 | 2024-05-12 | Llama 3 开源模型部署与 API 封装 | 部署教程 |
| 036 | 2024-05-26 | Mixtral 与 MoE:稀疏专家模型怎么省计算 | 原理教程 |
| 037 | 2024-06-09 | MoE 的路由、负载均衡与训练难点 | 原理教程 |
| 038 | 2024-06-23 | LoRA 原理:低秩矩阵为什么能微调大模型 | 原理教程 |
| 039 | 2024-07-07 | QLoRA 实战:在消费级显卡上微调模型 | 实战教程 |
| 040 | 2024-07-21 | SFT 指令微调:数据格式、清洗与训练 | 实战教程 |
| 041 | 2024-08-04 | 偏好优化:从 RLHF 到 DPO | 原理教程 |
| 042 | 2024-08-18 | DPO 实战:训练一个更符合业务偏好的模型 | 实战教程 |
| 043 | 2024-09-01 | RAG 进阶:Hybrid Search 与 Reranker | 架构教程 |
| 044 | 2024-09-15 | GraphRAG:知识图谱如何补足向量检索 | 架构教程 |
| 045 | 2024-09-29 | RAG 数据管道:解析 PDF、网页与表格 | 实战教程 |
| 046 | 2024-10-13 | LLM 安全:Prompt Injection 与越权工具调用 | 安全教程 |
| 047 | 2024-10-27 | Guardrails:输出过滤、策略判断与人工兜底 | 安全教程 |
| 048 | 2024-11-10 | LLM 观测:Tracing、Token 用量与失败样本 | 工程实践 |
| 049 | 2024-11-24 | 多模型路由:按质量、延迟和价格选择模型 | 架构教程 |
| 050 | 2024-12-08 | 2024 年总结:LLM 应用工程化检查清单 | 总结教程 |
2025:推理模型、智能体与推理基础设施
这一年的教程重点从“让模型回答”转向“让系统完成任务”:推理过程、工具循环、状态管理、评测和服务吞吐成为核心。
| 编号 | 建议发布时间 | 题目 | 形式 |
|---|---|---|---|
| 051 | 2025-01-05 | 推理模型兴起:为什么测试时计算开始变重要 | 发展史 |
| 052 | 2025-01-19 | Chain-of-Thought、ReAct 与 Tree-of-Thought 对比 | 原理教程 |
| 053 | 2025-02-02 | Test-time Compute:用更多推理换更高正确率 | 原理教程 |
| 054 | 2025-02-16 | DeepSeek-R1 的训练思路与开源影响 | 发展史 |
| 055 | 2025-03-02 | GRPO 入门:群体相对策略优化 | 原理教程 |
| 056 | 2025-03-16 | 推理模型的思维链评测与结果校验 | 评测教程 |
| 057 | 2025-03-30 | Agent 是什么:模型、工具、状态与循环 | 原理教程 |
| 058 | 2025-04-13 | ReAct Agent:从搜索工具开始实现智能体 | 实战教程 |
| 059 | 2025-04-27 | Tool Calling 的可靠性:Schema、重试与幂等 | 工程实践 |
| 060 | 2025-05-11 | 多智能体协作:什么时候值得拆成多个 Agent | 架构教程 |
| 061 | 2025-05-25 | MCP 协议入门:统一模型与外部工具的连接 | 协议教程 |
| 062 | 2025-06-08 | MCP Server 实战:为博客暴露搜索工具 | 实战教程 |
| 063 | 2025-06-22 | Computer Use:浏览器操作的状态机设计 | 实战教程 |
| 064 | 2025-07-06 | Agent Memory:短期记忆、长期记忆与用户画像 | 架构教程 |
| 065 | 2025-07-20 | Agent 失败模式:循环、幻觉、工具误用与失控 | 工程实践 |
| 066 | 2025-08-03 | Human-in-the-loop:高风险动作前的审批设计 | 安全教程 |
| 067 | 2025-08-17 | Agent 评测:任务成功率、轨迹质量与成本 | 评测教程 |
| 068 | 2025-08-31 | BrowserGym 与任务型 Agent 基准测试 | 评测教程 |
| 069 | 2025-09-14 | vLLM 推理服务:PagedAttention 与吞吐优化 | 部署教程 |
| 070 | 2025-09-28 | KV Cache:LLM 推理为什么会被显存卡住 | 原理教程 |
| 071 | 2025-10-12 | Continuous Batching 与服务并发 | 部署教程 |
| 072 | 2025-10-26 | Speculative Decoding:用小模型加速大模型 | 原理教程 |
| 073 | 2025-11-09 | FlashAttention:注意力计算的 IO 优化 | 原理教程 |
| 074 | 2025-11-23 | 量化实践:GPTQ、AWQ、GGUF 如何选择 | 部署教程 |
| 075 | 2025-12-07 | 2025 年总结:从 Copilot 到可执行 Agent | 总结教程 |
2026:当下值得学习的通用能力
截至 2026 年,具体模型名称和版本变化很快,因此这一组刻意选择不依赖单一厂商的长期主题,保证文章不会随着一次 API 升级就失效。
| 编号 | 建议发布时间 | 题目 | 形式 |
|---|---|---|---|
| 076 | 2026-01-04 | 从模型选型到能力路由:建立自己的 Model Gateway | 架构教程 |
| 077 | 2026-01-13 | LLM 网关设计:统一鉴权、限流、重试与审计 | 实战教程 |
| 078 | 2026-01-22 | 结构化生成的终极实践:JSON Schema 与类型安全 | 实战教程 |
| 079 | 2026-01-31 | LLM-as-a-Judge:自动评审的偏差与校准 | 评测教程 |
| 080 | 2026-02-09 | 构建黄金数据集:让评测从感觉变成证据 | 评测教程 |
| 081 | 2026-02-18 | Prompt 版本管理与回归测试 | 工程实践 |
| 082 | 2026-02-27 | 生产级 RAG:离线评测、在线监控与增量索引 | 架构教程 |
| 083 | 2026-03-08 | 多租户 AI 应用:隔离数据、配额和检索权限 | 架构教程 |
| 084 | 2026-03-17 | AI 应用的隐私保护:脱敏、留存与数据边界 | 安全教程 |
| 085 | 2026-03-26 | 版权与训练数据:工程师需要知道的边界 | 合规教程 |
| 086 | 2026-04-04 | 小模型路线:蒸馏、剪枝与任务专用模型 | 原理教程 |
| 087 | 2026-04-13 | Model Distillation 实战:把大模型能力压缩下来 | 实战教程 |
| 088 | 2026-04-22 | On-device AI:端侧推理的性能与隐私权衡 | 部署教程 |
| 089 | 2026-05-01 | AI Coding Agent 的代码库理解与补丁生成 | 实战教程 |
| 090 | 2026-05-10 | 软件工程 Agent:从 Issue 到可审查 Pull Request | 实战教程 |
| 091 | 2026-05-19 | 多模态 Agent:让模型读图、读表、读屏幕 | 实战教程 |
| 092 | 2026-05-28 | 实时语音 Agent:延迟预算与打断处理 | 架构教程 |
| 093 | 2026-06-06 | 长任务 Agent:检查点、恢复与幂等执行 | 架构教程 |
| 094 | 2026-06-15 | AI 系统成本核算:Token、GPU、存储与人工成本 | 工程实践 |
| 095 | 2026-06-24 | AI 系统的 SLO:质量、延迟、可用性与安全 | 工程实践 |
| 096 | 2026-07-03 | 从零搭建 LLM 应用 CI:测试、评测与发布门禁 | 实战教程 |
| 097 | 2026-07-12 | 读论文方法:如何拆解一篇大模型论文 | 学习教程 |
| 098 | 2026-07-21 | 复现论文的工程方法:环境、数据、指标与误差 | 学习教程 |
| 099 | 2026-07-30 | 100 篇之后怎么继续:建立个人 AI 技术雷达 | 学习教程 |
| 100 | 2026-08-08 | 大模型发展史总复盘:从生成文本到可执行系统 | 总结教程 |
推荐的单篇文章模板
每一篇尽量保持同一骨架,读者会更容易形成预期:
- 先讲一个具体问题和最终效果。
- 用一张图解释核心概念和数据流。
- 给出最小可运行代码,不先堆完整框架。
- 加入失败案例、日志和可重复的评测数据。
- 说明生产环境的成本、安全、延迟和边界。
- 最后给出 3 个练习题,并链接到本系列的前置文章。
这 100 篇的顺序不是不可改变的历史断言,而是一条从基础到生产的学习曲线。模型名称会更新,Token、注意力、检索、评测和系统可靠性这些底层问题不会很快消失。