Léonard Noth
ENFRDE
ki & daten

Nützlich schlägtbeeindruckend.

Ich habe Modelle trainiert, ausgeliefert und war derjenige, den man anruft, wenn sie driften. Drei verschiedene Dinge heissen „KI“ und gehören getrennt: was ins Produkt kommt, was die Daten dahinter verarbeitet, und wie die Software selbst entsteht.

01

Im Produkt

Ein Modell verdient seinen Platz im Produkt, indem es Arbeit abnimmt, die sonst jemand von Hand macht, nicht indem es das Feature ist.

Bei YEPA heisst das ein Klassifikator, der Freitext in die Kategorien einordnet, mit denen die Plattform arbeitet, damit der Rest des Systems gewöhnlicher Code mit vorhersagbarem Verhalten bleiben kann. Es ist ein kleines überwachtes Modell, kein gehostetes Allzweckmodell: günstig im Betrieb, auf einem zurückgehaltenen Testsatz messbar, und wenn es falsch liegt, dann auf eine Weise, die ich messen und nachtrainieren kann.

Meine Masterarbeit, SAFE, war derselbe Instinkt im Forschungsmassstab: zeitlichen Bezug, Sentiment und feinere Emotionen aus Finanznachrichten extrahieren und die Trennbarkeit prüfen, bevor man irgendetwas davon glaubt. Bewertet mit 6/6, vollständig veröffentlicht.

99.6%
zeitliche Klassifikation
98.8%
Sentiment
6’501
handgeprüfte Datensätze
02

In der Pipeline

Der interessante Einsatz eines grossen Modells ist nicht das Beantworten von Fragen. Er besteht darin, einer von mehreren Operatoren in einer Pipeline zu sein, die nächsten Monat erneut laufen und dasselbe liefern muss. Jede Stufe ist nummeriert, schreibt ihr Ergebnis auf die Platte und lässt sich einzeln erneut ausführen.

  1. 00

    Roh → Kategorien

    Zuerst Regex und Regeln. Was ein deterministischer Durchlauf lösen kann, sollte keinen Modellaufruf kosten.

  2. 01

    Modellgestützte Bereinigung

    Das LLM übernimmt nur, woran die Regeln scheitern: fehlerhafte Einträge, gemischte Sprachen, kaputte Kodierungen.

  3. 02

    Filtern

    Weg mit dem, was die Bereinigung geleert hat. Ein Schritt, der still Inhalt löscht, ist ein Schritt, den man nicht bemerkt.

  4. 03

    Entitäten & Umformulierung

    Namen, Orte, Institutionen erkennen und darum herum umformulieren, damit der Klassifikator die Form lernt, nicht die Person.

  5. 04

    Für Augmentierung formatieren

    Das Schema vor dem Generieren festlegen. Typisiert rein, typisiert raus.

  6. 05

    Augmentierung

    Varianten nur für die dünnen Klassen, an der Klassenverteilung gemessen, nicht blind angewandt.

  7. 06

    Embedding

    Ein Embedding-Durchlauf über den fertigen Satz, zwischengespeichert, damit erneutes Training günstig bleibt.

Heraus kommt ein Keras-Klassifikator, klein genug für ein Nachtraining auf dem Laptop. Teuer war nie das Training. Teuer war, die Daten ehrlich zu machen.

03

In der Werkstatt

Ich entwickle täglich mit Coding-Agenten. Das funktioniert nur, weil die Regeln aufgeschrieben sind und die Sperren echt.

„Vibe Coding“ heisst, Ergebnisse zu übernehmen, die man nicht gelesen hat. Was ich mache, kommt eher dem gleich, eine Codebasis zu führen, die ihre eigenen Konventionen gut genug dokumentiert, dass ein kompetenter Neuzugang (Mensch oder nicht) ihnen folgen kann, und das Ergebnis dann wie jeden anderen Beitrag zu prüfen.

Budgets, schriftlich

Die CLAUDE.md des Repos setzt Grössenlimits je Dateityp (200 Zeilen für eine Seite, 150 für eine Komponente, 100 für einen Hook) mit dem Hinweis, dass es Richtwerte sind. Eine zusammenhängende Komponente mit 210 Zeilen ist in Ordnung; eine mit 150 Zeilen, die drei unzusammenhängende Dinge tut, nicht.

Verfahren statt Prompts

Wiederkehrende Arbeit wird zu einer geschriebenen Skill, der der Agent folgt. Die zum Auslagern eines Features ins gemeinsame Paket hält die Fallstricke aus vier echten Migrationen fest: ins Gemeinsame auslagern, die zweite App anschliessen, die erste als dünne Hülle umbauen, und jede Änderung additiv halten, damit die App, die schon darauf läuft, nicht bricht.

Isolierte Branches

Agentenarbeit landet auf eigenen Branches und wird vor dem Merge gelesen. Dieselbe Prüfung wie bei allen anderen.

Harte Sperren

Deployments werden von einem Menschen freigegeben, Punkt. Es ist die erste Regel der Datei. Nichts läuft automatisch, und kein Agent staged jemals Secrets.

Derselbe Ansatz hat Atelier, meine eigene Videoproduktions-Suite hervorgebracht, und auch die Seite, die Sie gerade lesen.

Wo ich Grenzen ziehe

Regeln vor Modellen

Wenn eine Regex es löst, fragt man kein Modell. Günstiger, und es scheitert lesbar.

Gemessen, nicht vermutet

Eine Trennbarkeitsprüfung vor dem Training. Ein zurückgehaltener Testsatz danach. Eine Zahl, die ich vor einer Betreuerin verteidigen würde.

Ein Mensch gibt frei

Nichts geht in Produktion, weil eine Maschine zuversichtlich war. Deployen ist eine Entscheidung, die jemand trifft.