大模型理论、大模型应用开发、Prompt Engineering、Agent应用
Token 窗口、上下文压缩、持久化方案,高效管理对话历史。
窗口是什么、四大核心问题、主流模型上限对比,全程图解。
GPT/Claude/Gemini/Qwen/DeepSeek/GLM/豆包 各版本参数量级、窗口、最大输入输出全景对比与形象感知。
为什么需要 RAG、基础流程、关键模块(切分/Embedding/重排)、进阶(混合检索/Self-RAG)与常见坑,全程图解。
为什么 AI 代码助手用 grep 而不是 RAG?从工程约束到设计哲学的全面拆解。
从字节面试官之问出发,图解 Claude Code 检索循环、三大代价、两条查 bug 路径与面试四层答法。
向量相似度很高却召回错误文档?从语义歧义到混合检索,讲清 RAG 召回失败的真正原因。
从"看指标"到"拆链路",逐环节漏斗式排查、打标归类与回归沉淀,面试级实战框架。
效果天花板(召回/相似度/中间迷失/知识库)× 工程性能(延迟/成本),七个瓶颈配图拆解与缓解清单。
从指标到落地:检索/生成指标(RAGAS)、传统NLP指标、LLM-as-Judge、在线评估、完整评估方案、可算评分卡与工具对比。
原理、建设流程(9 步)、RAG、向量库选型、检索重排、上线路线图与避坑清单,全程图解。
从文档解析、清洗分块到向量化入库,完整理解知识库导入流程。
ReAct、工具调用、多 Agent 协作,构建智能 Agent 系统。
理解 Agent 与工作流的区别、选型边界和设计规范。
从工程实践出发,比较自研 Agent 与成熟框架的取舍。
从推理模式到 ReAct 实现,理解 Agent 的思考与行动循环。
多智能体的概念、协同方式与主流框架全览。
消息信封、拓扑选型、共享状态 vs 消息传递、协议握手与错误处理,附通信蓝图。
什么场景 Single-Agent 就够了、什么场景必须上 Multi-Agent,以及多 Agent 的中心化与去中心化取舍。
对比 ReAct、Plan-and-Execute 与 Reflection 的特点和选型。
MCP 协议、Server/Client、工具与资源,理解标准化 AI 接口。
MCP 本质、与硬编码 Tool 的六维区别、四大原语、通信生命周期与真实应用场景,全程图解。
两者都是给 AI 助手加能力的机制,但解决的问题完全不同——讲清选型边界。
从 TCP 与响应式取消传播讲起,解决流式输出下客户端断开后的资源治理与成本问题。
精读 OpenAI 官方工程博客:5 个月、3 人、0 行手写代码交付百万行级产品。拆解角色重定义、应用可读性、仓库即记录系统(地图而非手册)、分层架构约束、熵与垃圾回收,附可落地清单与三条误读警示。
理解 Claude Code 的记忆系统架构、存储机制与使用方法。
深入理解记忆文件的结构、格式与各个字段的含义。
可视化展示 Claude Code 记忆系统的完整结构与关系。
理解 Claude Code Auto Memory 的索引结构与自动记忆机制。
OpenClaw 记忆系统架构详解与实现原理。
OpenClaw 遗忘机制与倒排索引实现详解。
OpenClaw 完整工作流程与使用指南。
讲清楚文件存储、条目切片、鲜活度分数与记忆衰减的关系。
记忆如何被检索、注入 Prompt,以及为什么需要梦境来整理碎片。
OpenClaw 长期记忆文件的处理机制、截断策略与自动化维护。
从统计语言模型到 ChatGPT 与推理模型,时间轴 + 架构图解 + 趋势综述,全程图文。
从 CoT 到 GoT,梳理大模型规划能力的关键方法与演进。
理解思考模式开与不开的差异,以及推理能力的工作方式。
从范式、架构、工程到落地的完整对照:流水线 vs 单模型、判别式 vs 生成式、监督标注 vs 预训练+涌现,含 Scaling Law 与混合架构建议。
切块变 Token、视觉编码器、投影对齐、CLIP 对比学习,多张可交互图解讲清原理。
视觉编码器 + 投影器 + LLM 的三种对接范式,图文如何对齐、如何联合训练,全程图解。
从 GAN 到 Diffusion 再到 DiT,讲清扩散在「扩散」什么、Stable Diffusion 为什么快、CFG 与采样加速。
自注意力机制、多头注意力、位置编码,理解大模型的核心架构。
从输入到输出完整动态图解:可播放的架构流程步进器 + 真实计算的注意力计算器 + 因果掩码交互。核心记一句:Query 找 Key,加权取 Value。
Query/Key/Value 的原理、应用目的与解决什么问题,含注意力热力图与缩放交互演示。
用直观图解理解注意力如何聚焦上下文中的关键信息。
图书馆类比、词间注意力连线、分步计算器与多头切换,形象学懂 Attention。
为什么只缓存 K/V、自回归生成怎样省算力,以及跨请求前缀复用原理,含交互对比图。
从分词到 Softmax 到自回归接龙,图文+交互讲清"按概率输出"的每一步,含温度与逐字生成两个可玩 Demo。
理解激活函数的作用,以及 ReLU、GELU、SwiGLU 等常见选择。
区分"激活函数"与"神经元被激活",讲清参与计算 vs 被激活、稀疏激活与 MoE 激活参数,含可拖动灯阵演示。
从原理层讲清:无状态推理、权重只读、注意力只看窗口,以及记忆如何实现。
从大模型到小模型的知识迁移,理解模型压缩与轻量化技术。
Tokenization、BPE、词表与 Token 计数,彻底讲清 Token 是什么。
参数量级规模、如何划分,以及「参数」具体指哪些、如何估算。
从文本到向量空间,理解 Embedding、相似度计算与检索应用。
OpenAI/Cohere/BGE/GTE/E5 等主流嵌入模型的维度、参数量、效果与指标横向对比,帮你选型。
从海量语料学习通用能力,理解预训练的目标、过程与意义。
定义、迁移学习原理、LoRA、目的与应用场景,配图讲清 Fine-tuning。
LoRA / QLoRA / AdaLoRA / aLoRA / 全量微调的 11 维对比、演进链与 5 分钟选型决策树。
低秩分解、冻结基座、旁路残差——为什么微调大模型只需训练一张轻薄「贴纸」。
理解奖励、策略与反馈如何帮助模型在交互中持续优化。
幻觉的本质、根本原因,以及为什么现在幻觉大幅减少了。
从数据训练、提示、RAG、生成后校验到工具增强与治理,系统梳理降幻觉方案并配图对比。
大模型幻觉与上下文过长导致的注意力分散是同一个问题吗?本质区别、联动机制、诊断方法(位置×长度对照实验)与两套解决方案。
推理 vs 训练、吞吐/延迟/显存三大瓶颈、vLLM/TGI/TensorRT-LLM 引擎对比、批处理与流式,全程图解。
INT8/INT4/FP8、PTQ vs QAT、GPTQ/AWQ 原理、KV Cache 量化与混合精度,讲清「省显存不掉点」的秘密。
能力/对齐/安全三维度、自动指标 vs LLM-as-Judge、基准榜单与在线评估、RAGAS,面试级评估框架。
越狱/提示注入/数据投毒/奖励黑客、OWASP LLM Top 10,红队测试方法与防御手段,图文结合。
注意力为何无序、绝对/相对位置、RoPE 旋转直觉、ALiBi 偏置,以及长度外推权衡。
标准 O(n²) 瓶颈、FlashAttention(IO 感知)、MQA/GQA(共享 KV)、稀疏/线性注意力对比。
稀疏激活、路由 top-k、负载均衡辅助损失与专家容量、Mixtral/DeepSeek 代表与坑。
BatchNorm 为何不适合序列、LayerNorm、RMSNorm 更省、Pre-LN vs Post-LN 训练稳定性。
Encoder-only/Decoder-only/Encoder-Decoder 的注意力掩码差异,及 LLM 时代 Decoder-only 胜出原因。
greedy/beam search、temperature、top-k、top-p(nucleus) 的确定性-多样性取舍与默认选型。
zero/few-shot、为何免训练也能学会任务、与微调的边界、近因偏差与窗口限制。
few-shot/zero-shot CoT、Self-Consistency 投票、ToT 树搜索,及为何显式推理能提准确率。
Kaplan 幂律、Chinchilla(数据/参数等比例)、涌现能力争议,及训练预算分配启示。
图文双塔、InfoNCE 对比损失、零样本分类机制,及作为 VLM/扩散/检索的多模态基石。
稠密 vs 稀疏向量、最近邻本质、为什么传统数据库做不了语义检索,以及编码→建索引→检索→重排的完整链路。
余弦、内积、欧氏三种度量的公式与直觉;为什么归一化后内积等于余弦,以及建索引/查询度量必须一致的坑。
1 万→1 亿行下暴力与 ANN 的耗时、QPS、召回率对照,以及维度与内存两个隐藏瓶颈。
为什么不能暴力、召回率定义与代价、树/哈希/量化/图四大类方法对比,以及工业界现状。
稠密检索短板与 BM25 互补;两路召回后如何用 RRF / 加权 / 学习排序融合,何时该上混合检索。
6 个决策维度 + 决策树给出 FLAT/HNSW/IVF-PQ 选用边界,并对比主流向量库与上线清单。
function calling 协议、工具 schema 设计、并行调用、错误重试与人工确认,Agent 落地的关键一环。
从历史、背景到发展与应用场景,用时间线、对比图与订机票故事,讲清函数调用如何让大模型从「会聊」变「会干」。