Open source · Rust
Rich Triplet
Un LLM completo, costruito da zero in Rust — senza una singola dipendenza di ML. Inferenza di Gemma 3 su Apple Silicon, decode su GPU Metal a oltre 17 token/s con ~6 GB di RAM.
- Rust
- Zero dipendenze ML
- Apple Silicon · Metal
- 412 test
$ rich-triplet --model gemma3-4b \
--prompt "What is the capital of France?" --temp 0.8
→ loading gemma-3-4b-it-q4_0.gguf · 34 layers · Metal
The capital of France is Paris.
▸ 17.3 tok/s · ~6 GB RAM
Cosa c’è dentro
Ogni componente scritto a mano, dai tensori ai kernel GPU. Niente scatole nere, niente magia.
Zero dipendenze ML
Algebra di matrici, autodiff, attention, quantizzazione e tokenizer: tutto scritto a mano. Nessuna libreria di machine learning.
Inferenza Gemma 3
Esegue Gemma 3 4B da pesi GGUF Q4_K_M / Q4_0: prefill su CPU, decode su GPU, KV cache in memoria unificata.
GPU Metal full-graph
Il forward completo codificato in ~717 dispatch dentro un solo command buffer Metal. 17,3 token/s su Apple Silicon.
Tre transformer
GPT-2, GPT-OSS (RoPE, GQA, Mixture of Experts) e Gemma 3 (sliding window, blocchi a quattro norm).
Autodiff a grafo
Un motore di differenziazione automatica costruito da zero: regola della catena, VJP di matrici, GEMV Q4K/BF16, ARM NEON + SDOT.
412 test
Correttezza verificata: gradienti con differenze finite, forme dell’attention, quantizzazione, kernel Metal e tokenizer.
Open source
Leggi il codice
È tutto nel repository: oltre 12 moduli Rust, dai tensori ai kernel Metal, con benchmark e 412 test. Clonalo, leggilo, eseguilo.
Apple Silicon consigliato per il decode su GPU Metal.