学习
关于底层机器的笔记——这些系统实际是怎么算的,而不是通常怎么被描述的。该动手的地方就能动手。
Interactive
神经网络
注意力究竟做了什么
用一台 8 维、2 层、2 头的真 Transformer,把同一次前向传播和反向传播摊开:QKᵀ 怎样现场生成连接比例,A×V 怎样搬运内容,答案误差又怎样反过来训练“连谁、搬什么”。从 100 道乘法一路推到语言模型。
浏览器内从零训练
真源码单步执行
零后端零依赖
Interactive
神经网络
会加减乘除,就能训会一个神经网络
用 0~9 的全部 100 道乘法搭一台 2,554 参数 MLP。从一条前向因果链和一个共享参数的责任出发,亲手推出损失、梯度、批量训练与反向传播;100/100 与泛化的边界也明确写清。
浏览器内从零训练
代码可单步执行
零后端零依赖
Interactive
状态估计
扩展卡尔曼滤波,从直觉开始推
雅可比矩阵到底是从哪来的、协方差更新为什么写成那个样子、以及线性化不好时具体是什么坏掉了。是推出来的,不是抄来的——然后拿 GPS、轮速计和 IMU 现场融一遍。
可运行的模拟
滤波代码能改
每一步都推
Interactive
神经网络
一个小到能读完的 transformer
原样使用 pure-web 分支:8 维、2 层、2 头、3,136 参数的 decoder-only Transformer。TensorFlow.js 与 WASM 后端都随页面打包;训练、推理、参数表、前向追踪和 3D 走查全部在浏览器里运行。
pure-web 原版
2 层 · 2 头 · 8 维
内置 TF.js + WASM