RockDesk

学习

关于底层机器的笔记——这些系统实际是怎么算的,而不是通常怎么被描述的。该动手的地方就能动手。

Interactive 神经网络

注意力究竟做了什么

用一台 8 维、2 层、2 头的真 Transformer,把同一次前向传播和反向传播摊开:QKᵀ 怎样现场生成连接比例,A×V 怎样搬运内容,答案误差又怎样反过来训练“连谁、搬什么”。从 100 道乘法一路推到语言模型。

浏览器内从零训练 真源码单步执行 零后端零依赖
Interactive 神经网络

会加减乘除,就能训会一个神经网络

用 0~9 的全部 100 道乘法搭一台 2,554 参数 MLP。从一条前向因果链和一个共享参数的责任出发,亲手推出损失、梯度、批量训练与反向传播;100/100 与泛化的边界也明确写清。

浏览器内从零训练 代码可单步执行 零后端零依赖
Interactive 状态估计

扩展卡尔曼滤波,从直觉开始推

雅可比矩阵到底是从哪来的、协方差更新为什么写成那个样子、以及线性化不好时具体是什么坏掉了。是推出来的,不是抄来的——然后拿 GPS、轮速计和 IMU 现场融一遍。

可运行的模拟 滤波代码能改 每一步都推
Interactive 神经网络

一个小到能读完的 transformer

原样使用 pure-web 分支:8 维、2 层、2 头、3,136 参数的 decoder-only Transformer。TensorFlow.js 与 WASM 后端都随页面打包;训练、推理、参数表、前向追踪和 3D 走查全部在浏览器里运行。

pure-web 原版 2 层 · 2 头 · 8 维 内置 TF.js + WASM