Grimoire
Standing note
Kept open, revised often.
32 entries, 6 stubs.
No prose written by a model.

The AI Engineer's Grimoire

A field reference for how these systems actually work: attention and its cheaper cousins, training dynamics that fail quietly, inference kernels, the interpretability toolkit, and the attack surface that follows all of it.

Each entry begins with the maths and ends with something you can run. Nothing is explained twice.

Query log
$ grimoire search
Categories
01
Architectures — attention variants, position schemes, normalisation, sparse blocks
5
02
Training — optimisers, schedules, sharding, RL objectives, stability failures
5
03
Fine-tuning — PEFT families, adapter merging, data curation, catastrophic drift
3
04
Inference — kernels, KV-cache layouts, quantisation, speculative decoding
5
05
Interpretability — circuits, SAEs, causal interventions, probing, feature geometry
7
06
Adversarial ML — evasion, extraction, poisoning, privacy leakage, agent hijacks
4
07
Evaluation — metrics, preference aggregation, contamination, statistical power
3
Recent revisions
Scaled Dot-Product Attention
Content-based retrieval over key–value pairs with 1/√d_k logit scaling.
Architectures · revised 4d ago
O(n²·d)
Sparse Autoencoders
Overcomplete dictionary learning on activations for monosemantic features.
Interpretability · revised 4d ago
O(d·m)
FlashAttention
Tiled, IO-aware attention kernel; recomputes softmax statistics online.
Inference · revised 6d ago
O(n²·d)
Speculative Decoding
Draft model proposes tokens; target model verifies in one pass.
Inference · revised 6d ago
O(γ·n)