Vai al contenuto
hartwellbridge

Open source · Rust

Rich Triplet

Un LLM completo, costruito da zero in Rust — senza una singola dipendenza di ML. Inferenza di Gemma 3 su Apple Silicon, decode su GPU Metal a oltre 17 token/s con ~6 GB di RAM.

  • Rust
  • Zero dipendenze ML
  • Apple Silicon · Metal
  • 412 test
rich-triplet — zsh

$ rich-triplet --model gemma3-4b \

--prompt "What is the capital of France?" --temp 0.8

→ loading gemma-3-4b-it-q4_0.gguf · 34 layers · Metal

The capital of France is Paris.

▸ 17.3 tok/s · ~6 GB RAM

Cosa c’è dentro

Ogni componente scritto a mano, dai tensori ai kernel GPU. Niente scatole nere, niente magia.

Zero dipendenze ML

Algebra di matrici, autodiff, attention, quantizzazione e tokenizer: tutto scritto a mano. Nessuna libreria di machine learning.

Inferenza Gemma 3

Esegue Gemma 3 4B da pesi GGUF Q4_K_M / Q4_0: prefill su CPU, decode su GPU, KV cache in memoria unificata.

GPU Metal full-graph

Il forward completo codificato in ~717 dispatch dentro un solo command buffer Metal. 17,3 token/s su Apple Silicon.

Tre transformer

GPT-2, GPT-OSS (RoPE, GQA, Mixture of Experts) e Gemma 3 (sliding window, blocchi a quattro norm).

Autodiff a grafo

Un motore di differenziazione automatica costruito da zero: regola della catena, VJP di matrici, GEMV Q4K/BF16, ARM NEON + SDOT.

412 test

Correttezza verificata: gradienti con differenze finite, forme dell’attention, quantizzazione, kernel Metal e tokenizer.

Open source

Leggi il codice

È tutto nel repository: oltre 12 moduli Rust, dai tensori ai kernel Metal, con benchmark e 412 test. Clonalo, leggilo, eseguilo.

Apri su GitHub

Apple Silicon consigliato per il decode su GPU Metal.