Skip to content

与应用站、评测站及 Agent 系统的生态边界 ​

本页定义 llm.zenheart.site(Learn LLM)与同生态项目(evals.zenheart.site、自举 Agent zen、ai.zenheart.site)的定位、分工与验收边界。各站点独立闭环、各司其职,不以泛化调用替代底层理解,也不以页面 Demo 代替工程证据。

一、ZenHeart AI 体系四维矩阵 ​

维度Learn LLM(本站)
llm.zenheart.site
大模型评估(Evals)
evals.zenheart.site
自举编码 Agent(Zen)
zen
应用工程(Learn AI)
ai.zenheart.site
核心命题模型内部在算什么?我能否从零手写、解释张量并排查故障?主流厂商每次发布公布哪些评估?如何读懂报告与帕累托选型?如何构建一个内核零依赖、最简原语、可自举进化的真实编码 Agent?如何调用商用 API/SDK 做出可维护、带交互的产品功能?
学习路径第1章环境准备 + 第2–22章:从标量 autograd 到 Transformer、KV Cache、后训练、DeepSeek 架构、可恢复 Agent 与 Capstone;第23章收在毕业后的结构取舍读法4 大模块 32 章:建立框架认知 → 标准评测流水线 → 厂商评测全景 → 评估框架实战 + 65 个 Benchmark 字典M0(最小循环 + 纯自建工具 + REPL)→ M1(内核自举)→ 交互式教学沙箱Prompt 工程、函数调用、上下文组装、业务工作流与全栈交付
主要技术栈Python、NumPy、必要时 PyTorch;前端 VitePress 交互式数学组件Node.js、VitePress 静态站点、实体化 Benchmark JSON 数据库TypeScript(内核严格零外部依赖)、纯 Node.js 原语TypeScript / Node.js、主流前端框架、云服务 SDK
可验证证据固定 seed、张量 shape 与 loss 对拍、故障注入断言、离线 Harness Replay厂商报告一手证据链(A 级来源)、Benchmark 形式化参数、Scorecard 校准CI 零依赖检测、Loop 不变量断言、状态事件流录制功能端到端测试、集成测试、生产可观测性指标
成功标准L3 从零手写/调试/解释,L2 测量/比较;通过 22 章严格质量与证据门禁读懂技术报告与 Elo 榜单,独立设计领域评测集并计算多目标非支配前沿内核代码完全可读、完全可改,最终实现 Agent 自开发 Agent产品功能按时上线、业务安全兜底、用户交互流畅

二、本站覆盖与边界划分 ​

  1. 核心算法主线(第2–12章):完整覆盖 decoder-only LLM 核心算法链路——Python 与数学直觉桥梁、标量 autograd、概率自回归、BPE 分词、训练稳定性与混合精度、Scaled Dot-Product Attention、TinyGPT 预训练、KV Cache/RoPE/量化、SFT/LoRA 与 DPO 对齐,以及 DeepSeek 核心架构剖析(MLA、DeepSeekMoE、GRPO)。
  2. 生产 Agent 基础(第13–22章):覆盖带引用与 ACL 的 RAG、生产级检索(KNN+RRF)、结构化工具调用与 MCP 协议、商用 LLM API(退避重试/流式)、Prompt 工程与多模式记忆、LangGraph 框架映射、流式交付 SSE、Multi-Agent 编排、评估安全与云端交付,以及 Capstone 综合实战。
  3. 刻意划定的边界(L1 认知级):
    • 工业级分布式集群(3D 并行、DeepSpeed、Megatron-LM)只讲原理与通信代价,不在此实现昂贵的分布式集群框架。
    • 教学 TinyGPT 只证明算法因果机制,不充当通用推理规划器;第 16 章后的真实任务通过 OpenAI 兼容端点接驳云端模型或离线录制 Fixture。
    • 外部框架(LangChain / LangGraph)仅作为第 15、18 章的可选抽象对照:学习者必须先手写显式 loop 与 policy,再理解框架封装的代价;框架不自动提供业务权限与安全保证。
    • Google Cloud 真实验证严格要求第 1 章资格审计、Job execution/checkpoint、image digest、私有 revision 与 48 小时账单回读;本地 dry-run 绝不冒充云通过。

三、跨项目迁移与协同顺序 ​

  • 从 Learn LLM 迁移到 Evals:保留指标定义(Accuracy、Citation、Refusal、Cost)、冻结分母与 Judge 校准思维;补齐对工业界标准化评测集(MMLU、SWE-bench、Chatbot Arena)的背景认知与帕累托前沿选型技能。
  • 从 Learn LLM 迁移到 Zen:将手写的状态机提升为生产级自举架构;严格遵守 Loop 三条不变量(状态显式化、单步可观测、执行有边界),以零依赖原语抵抗软件腐化。
  • 迁移到业务落地(Learn AI):保留状态机防线、Schema 契约、重试退避与审计日志;补充业务数据权限、审批工作流与真实前端交互。

私有学习站 · 原理从零构建 · 勿提交个人隐私或密钥