Python
19. Jun 20267. May 20265. May 20263. May 202630. Apr 202624. Apr 202622. Apr 202621. Apr 202620. Apr 202618. Apr 2026
Lokales Python auf dem Mac: Gemma 4, sein Coding-Finetune und ein aktueller Spezialist
Gemma 4 12B gilt als das kompletteste lokale Modell. Für Python habe ich drei Varianten auf einem M3 Max gegeneinander laufen lassen, mit echter Code-Ausführung, inklusive eines Parsers, an dem alle drei scheitern.
Bonus: Wir bauen Lal — ein kleines Basismodell aus den Bauteilen der Serie
Acht Artikel Theorie, ein Bonus-Kapitel Praxis. Wir führen alle Code-Bausteine der LLM-Serie zu einem lauffähigen Mini-Sprachmodell zusammen, trainieren es auf TinyShakespeare und hängen einen winzigen SFT-Schritt an. Mit Augenzwinkern Richtung Star Trek TNG.
Fine-Tuning, vom Basismodell zum Assistenten
Wie aus einem Basismodell, das Texte vervollständigt, ein hilfreicher Assistent wird. Supervised Fine-Tuning, RLHF, DPO und Constitutional AI — das letzte Stück der LLM-Pipeline, mit der ehrlichen Frage, was Alignment eigentlich löst.
Der Transformer, die vollständige Architektur
Position, Tiefe, Stabilität — was zu Attention dazukommt, damit ein vollständiger Transformer entsteht. Positional Encodings, Feed-Forward-Schichten, Residual Connections, Layer Normalization, der ganze Block in Python und der Sprung zu GPT, BERT, Llama und Claude.
Attention Is All You Need
Wie aus dem Bottleneck der RNNs ein Mechanismus wurde, der jeden Token mit jedem anderen verbindet. Query, Key, Value, Multi-Head und das Paper, das die NLP-Welt umkrempelte, erklärt mit Bibliotheks-Bildern und etwas Mathe für die, die es genau wissen wollen.
Kontext und RNNs — warum Reihenfolge zählt
Warum Sprache Gedächtnis braucht, und wie die ersten Sprachmodelle diesen Kontext gelernt haben. Rekurrente Netze, LSTMs und das Problem mit langen Sätzen, erklärt ohne Formel-Gewitter.
Backpropagation — wie ein Modell lernt
Wie neuronale Netze aus Fehlern lernen. Loss, Gradienten, Chain Rule, Gradient Descent — Backpropagation von Hand implementiert auf einem 2-Layer MLP das XOR und Token-Vorhersage lernt.
Neuronale Netze von Grund auf
Was zwischen Embedding und Logit passiert. Neuronen, Layer, Forward Pass und Aktivierungsfunktionen — vollständig in numpy implementiert, ohne Framework-Magie.
Wörter als Punkte im Raum — was Embeddings wirklich sind
Wie Sprachmodelle Bedeutung in Zahlen kodieren. Embedding-Tabellen, Cosine Similarity, Vektorarithmetik und warum King minus Man plus Woman gleich Queen ergibt.
Das nächste Wort — wie Sprachmodelle funktionieren
Was passiert zwischen Eingabe und Antwort? Tokens, Wahrscheinlichkeitsverteilungen und Sampling-Strategien — Schritt für Schritt erklärt, mit echtem Code.