ki & datenNützlich schlägtbeeindruckend.
Ich habe Modelle trainiert, ausgeliefert und war derjenige, den man anruft, wenn sie driften. Drei verschiedene Dinge heissen „KI“ und gehören getrennt: was ins Produkt kommt, was die Daten dahinter verarbeitet, und wie die Software selbst entsteht.
Ein Modell verdient seinen Platz im Produkt, indem es Arbeit abnimmt, die sonst jemand von Hand macht, nicht indem es das Feature ist.
Bei YEPA heisst das ein Klassifikator, der Freitext in die Kategorien einordnet, mit denen die Plattform arbeitet, damit der Rest des Systems gewöhnlicher Code mit vorhersagbarem Verhalten bleiben kann. Es ist ein kleines überwachtes Modell, kein gehostetes Allzweckmodell: günstig im Betrieb, auf einem zurückgehaltenen Testsatz messbar, und wenn es falsch liegt, dann auf eine Weise, die ich messen und nachtrainieren kann.
Meine Masterarbeit, SAFE, war derselbe Instinkt im Forschungsmassstab: zeitlichen Bezug, Sentiment und feinere Emotionen aus Finanznachrichten extrahieren und die Trennbarkeit prüfen, bevor man irgendetwas davon glaubt. Bewertet mit 6/6, vollständig veröffentlicht.
99.6%
zeitliche Klassifikation
6’501
handgeprüfte Datensätze
Der interessante Einsatz eines grossen Modells ist nicht das Beantworten von Fragen. Er besteht darin, einer von mehreren Operatoren in einer Pipeline zu sein, die nächsten Monat erneut laufen und dasselbe liefern muss. Jede Stufe ist nummeriert, schreibt ihr Ergebnis auf die Platte und lässt sich einzeln erneut ausführen.
- 00
Roh → Kategorien
Zuerst Regex und Regeln. Was ein deterministischer Durchlauf lösen kann, sollte keinen Modellaufruf kosten.
- 01
Modellgestützte Bereinigung
Das LLM übernimmt nur, woran die Regeln scheitern: fehlerhafte Einträge, gemischte Sprachen, kaputte Kodierungen.
- 02
Filtern
Weg mit dem, was die Bereinigung geleert hat. Ein Schritt, der still Inhalt löscht, ist ein Schritt, den man nicht bemerkt.
- 03
Entitäten & Umformulierung
Namen, Orte, Institutionen erkennen und darum herum umformulieren, damit der Klassifikator die Form lernt, nicht die Person.
- 04
Für Augmentierung formatieren
Das Schema vor dem Generieren festlegen. Typisiert rein, typisiert raus.
- 05
Augmentierung
Varianten nur für die dünnen Klassen, an der Klassenverteilung gemessen, nicht blind angewandt.
- 06
Embedding
Ein Embedding-Durchlauf über den fertigen Satz, zwischengespeichert, damit erneutes Training günstig bleibt.
Heraus kommt ein Keras-Klassifikator, klein genug für ein Nachtraining auf dem Laptop. Teuer war nie das Training. Teuer war, die Daten ehrlich zu machen.
Ich entwickle täglich mit Coding-Agenten. Das funktioniert nur, weil die Regeln aufgeschrieben sind und die Sperren echt.
„Vibe Coding“ heisst, Ergebnisse zu übernehmen, die man nicht gelesen hat. Was ich mache, kommt eher dem gleich, eine Codebasis zu führen, die ihre eigenen Konventionen gut genug dokumentiert, dass ein kompetenter Neuzugang (Mensch oder nicht) ihnen folgen kann, und das Ergebnis dann wie jeden anderen Beitrag zu prüfen.
Budgets, schriftlich
Die CLAUDE.md des Repos setzt Grössenlimits je Dateityp (200 Zeilen für eine Seite, 150 für eine Komponente, 100 für einen Hook) mit dem Hinweis, dass es Richtwerte sind. Eine zusammenhängende Komponente mit 210 Zeilen ist in Ordnung; eine mit 150 Zeilen, die drei unzusammenhängende Dinge tut, nicht.
Verfahren statt Prompts
Wiederkehrende Arbeit wird zu einer geschriebenen Skill, der der Agent folgt. Die zum Auslagern eines Features ins gemeinsame Paket hält die Fallstricke aus vier echten Migrationen fest: ins Gemeinsame auslagern, die zweite App anschliessen, die erste als dünne Hülle umbauen, und jede Änderung additiv halten, damit die App, die schon darauf läuft, nicht bricht.
Isolierte Branches
Agentenarbeit landet auf eigenen Branches und wird vor dem Merge gelesen. Dieselbe Prüfung wie bei allen anderen.
Harte Sperren
Deployments werden von einem Menschen freigegeben, Punkt. Es ist die erste Regel der Datei. Nichts läuft automatisch, und kein Agent staged jemals Secrets.
Derselbe Ansatz hat Atelier, meine eigene Videoproduktions-Suite hervorgebracht, und auch die Seite, die Sie gerade lesen.
Wo ich Grenzen ziehe
Regeln vor Modellen
Wenn eine Regex es löst, fragt man kein Modell. Günstiger, und es scheitert lesbar.
Gemessen, nicht vermutet
Eine Trennbarkeitsprüfung vor dem Training. Ein zurückgehaltener Testsatz danach. Eine Zahl, die ich vor einer Betreuerin verteidigen würde.
Ein Mensch gibt frei
Nichts geht in Produktion, weil eine Maschine zuversichtlich war. Deployen ist eine Entscheidung, die jemand trifft.