原系列按「读到什么写什么」的顺序写成,同一个主题散在好几篇里,后面的篇章还在修正前面的结论。这门课把 20 篇拆开,按概念重新排序。每一讲都按同样四步走:先想一题,读后重建,动手算,用到自己的领域。
目标不是记住 20 篇,而是让它们在遇到新问题时「不请自来」(⑬)。
整个系列只追问一件事:同样叫「智能」,碳基和硅基把钱花在了哪里?
贯穿全程的工具箱:怎么判断一个说法有多可信(⑧ ⑩ ⑪ ⑳)。
⑳ 放到最前。它原本是全系列的复习,但「把借来的词换回机器义」是读其余 19 篇的前提。否则「学习」「记忆」「专家」这些词会一路误导你。
② 拆开用。「控制不在大脑里」讲分布式控制,「雌雄只差几根线」讲少数控制点,两条都放进第 2 单元。
⑰ ⑲ 挪进「护」。个体化和夜炼说到底是一个长期运行的系统怎么成长而不变坏,和 ⑦ 的睡眠清理是同一个问题。
⑩ ⑪ 放到最后。核查方法要见过足够多内容才用得上。而且 ⑪ 本身就在修正 ⑩,正好用「结论也会被修正」收尾。
每个拟人术语借你一半直觉,也埋你一个推论。先换回机器义,再看那句话还剩多少。
效应大小不取决于机制多漂亮,取决于你拿什么跟它比。
「生酮饮食让难治性抑郁评分下降 10.5 分」。这个数字能说明生酮有效吗?还缺什么?
随身卡片:替换题加对照组题。之后每个单元读完,都用这两题过一遍。
电脑和脑的效率差距不在「算」,在「搬」。稠密、专家混合、脑,是同一道算式下的三级台阶;第二级到第三级隔的是架构,不是工艺。
如果明年芯片算力翻 10 倍,你本地大模型的写字速度会翻几倍?
这是整门课唯一能亲手测的一讲,也是 ⑫ 的原始实验。
每秒字数上限 = 内存带宽 ÷ 每字搬运量
M3 Ultra 带宽 ≈ 819 GB/s GLM-5.3 每字搬运 ≈ 400 亿参数 × 4bit ≈ 20 GB(含开销约 22 GB) 理论上限 ≈ 819 ÷ 22 ≈ 37 字/秒
刻度 0–40 字/秒。实测数据见 eval/results/glm-5.3-4bit/metrics.json
cd ~/ai-learning/eval && ../.venv/bin/python run_eval.py qwen3-4b 1-speed
用「后厨」类比,给没读过的人讲清三级台阶,不超过 5 句话。
脑有三层设计:连哪些线、两端是什么零件、线上写多大的数。大模型只有最后一层。
稀疏(用多少)和可定位(住哪里)是两个维度,MoE 只学到了稀疏。
「果蝇脑 ≈ 0.026B 参数的模型」。这个换算漏掉了什么?
| 层 | 脑 | 大模型 |
|---|---|---|
| 哪些线连上 | ? | ? |
| 线的两端是什么 | ? | ? |
| 线上写多大的数 | ? | ? |
再加一行:把「分区」拆成稀疏和可定位两维,脑、稠密模型、MoE 各占几维?
有向连接可能数 166,700 × 166,699 ≈ 278 亿 实际突触 ≈ 5,450 万 占比 ≈ 0.196% ✔
平均每个神经元连出几条?自己算,再和 ③ 写的「389 条」对比(见勘误)。
权重和接线都不是仓库,而是被改变了的系统本身,所以没法查、没法删、没有目录。
权重可以逐字节复制,结构原理上不可下载。能被复制的能力,价格向复制成本趋零。
为什么「让模型彻底忘掉某条隐私」至今没有干净的解法?
⑬ 的结论在「个体化模型」出现之前成立。这一点在第 5 单元展开。
脑的发育同时听多种不可互换的信号:代谢说造得起什么,接触说邻居要什么。大模型训练只有一个梯度。
模仿复制的是答案分布,不是产生答案的结构。走样堆在示范最稀、结构最深、链条最长的地方,也就是难判断。
文明的基本动作是导出→重建。走样既是税,也是变异的引擎;有没有校验,决定走样收敛还是发散。
两个模型在公开排行榜上只差 2 分,在你自己出的判断题上差 20 分。为什么?
每步九成像,走 N 步后还剩: 5 步 0.9⁵ ≈ 0.59 10 步 0.9¹⁰ ≈ 0.35 20 步 0.9²⁰ ≈ 0.12
这就是「难题的链条长,走样会复利」。
脑的省力不在某一环特别强,而在每一环都有机制,并且都不用它自己操心。AI 的每一道都是外挂,开关在用的人手上。
长期运行的系统要成长又不变坏,碳基和硅基收敛到同一个答案:把「用」和「改」分到两个时段。
这一单元对你最实用,因为你正在运行这样一个系统。
你的 agent 最近是不是有时「变糊涂」?你觉得是模型变差了,还是别的原因?
| 环节 | 脑怎么做 | 我的 AI 系统怎么做 | 谁来喊 |
|---|---|---|---|
| 入口 ⑨ | ? | ? | ? |
| 清理 ⑦ | ? | ? | ? |
| 固化 ⑲ | ? | ? | ? |
| 失效 ⑤ | 管道三处同时变窄 | ? | — |
按 ⑦ 的三种糊涂各查一次:
失真不是随机的,有固定的形状,越隐蔽的越像对的。最隐蔽的失真不在文字里,而在文字与出处、出处与领域之间的接缝上。
一篇文章给了真实的 DOI。这能说明引用是对的吗?
| 层 | 查什么 | 成本 | 能抓到什么 |
|---|---|---|---|
| 一 · 稿子内部 | 前后矛盾;把它自己给的数字互相除一下 | 最低 | 数量最多,影响有限 |
| 二 · 稿子与出处 | 打开原文,先读标题和摘要最后一句 | 中 | 结论用反、署名不符、作者错 |
| 三 · 出处在领域里 | 方法被质疑过吗?模型转化过吗?「尚有争议」展开是什么? | 最高 | 数量少,但会改变判断 |
从最近收到的公众号或科普里选一篇,按三层核一遍,结果写成一张表。按 ⑪ 的建议,做不完时从第三层往回砍,因为第一层最便宜,随时能补。
⑪ 修正了 ⑩ 的一句话:给了完整引用只是可查性信号,不是准确性保证。要记的是修正后的版本。
同一条教训出现了三次:⑨ ⑩ ⑪ 里作者三次掉进自己写过的坑(说「已落盘」其实没落;凭记忆写的论文编号取回来是另一篇)。知道坑在哪,和不掉进去,是两件事。所以核查要做成固定动作,不能靠记性。
按 ⑮ 的原则,结业只考原文里没有的题。能答好,说明结构长成了;只能复述原文,说明还停在「像」。任选 4 道,每道 300 字以内。
选一个单元,用你自己的话、自己领域的例子,写一篇给别人看的短文或讲一次。按 ⑯ 的说法,教是唯一能自测保真度的导出格式。
系列每篇末尾的「三行,留着复习」就是现成的卡片。
按 ⑬ 的说法,这不是啰嗦,是「雕刻的下一凿」。
按第 6 单元的精神,对原系列也核了一遍。能算的数字大部分对得上:① 的 328 万倍和 62 万倍、③ 的 0.196%、⑫ 的 37 字/秒、⑮ 的 0.9¹⁰ ≈ 0.35。以下几处需要注意:
这些都不影响任何一篇的主要结论。按系列自己的标准,「一条边看错,整段回路的意思就变了」(③),值得改掉。
| ① | 模拟一个大脑,缺的不是算力 | 1 算 |
| ② | 控制不在大脑里 | 2 存 |
| ③ | 真正的设计,藏在没连上的那些线里 | 2 存 |
| ④ | 大模型里的零件,全都长得一样 | 2 存 |
| ⑤ | 衰退的一部分,不在神经元里,在管道里 | 5 护 |
| ⑥ | 脑不是照图纸长出来的 | 4 学 |
| ⑦ | 脑睡一觉就清理了,我得有人喊 | 5 护 |
| ⑧ | 机制讲得通,和在人身上有多大用,差一个对照组 | 0 读法 |
| ⑨ | 脑在门口拦,我在屋里堆 | 5 护 |
| ⑩ | 我核了十二篇科普,失真只有六种形状 | 6 核 |
| ⑪ | 读得再仔细,也抓不到最深的那几处 | 6 核 |
| ⑫ | 机器学会了配菜,还没学会把肉长在灶台上 | 1 算 |
| ⑬ | 下载一个读过半个互联网的脑,只要二十分钟 | 3 存·续 |
| ⑭ | 知识不是存进去的,是长成的 | 3 存·续 |
| ⑮ | 背熟了所有答案,还是成不了师傅 | 4 学 |
| ⑯ | 文明是一场有损传输 | 4 学 |
| ⑰ | 个体化模型:拿复制权,换成长权 | 5 护 |
| ⑱ | 模型里的「专家」,不是你以为的专家 | 2 存 |
| ⑲ | 个体化的后门:给机器配一个睡眠 | 5 护 |
| ⑳ | 把借来的词,换回机器义 | 0 读法 |