Oder: was passierte, als wir Claude Code auf unser Produkt zur Unternehmensführung des Vorstands losliessen und es dazu brachten, bei jedem einzelnen Schritt seine Arbeit zu beweisen.

Offenlegung: Ceetrix ist eine Plattform, die von einem engen Freund von mir entwickelt wurde, einem ehemaligen Googler, erfahrenen Chief Product Officer und Experten für agentische KI.

Hier ist ein Problem, über das kaum jemand spricht, bis es sie trifft: Die meisten kleinen und mittelständischen Unternehmen betreiben ihre Unternehmensführung nach Gefühl. Ein Beschluss wird in einer Sitzung "verabschiedet", jemand ändert in einer Tabelle ein Statusfeld von Ausstehend auf Genehmigt, und sechs Monate später, wenn der Anwalt eines Investors fragt, wer das eigentlich abgezeichnet hat, wann, und ob sich zwischen der Abstimmung und der endgültigen Fassung etwas geändert hat, lautet die ehrliche Antwort: ein Achselzucken und ein Durchscrollen alter E-Mail-Verläufe. Ich habe diese genaue Szene schon mehr als einmal erlebt.

Das ist das Problem, für das wir Software entwickeln, um es zu lösen. Und die letzten zwei Tage haben uns eine seltsame, irgendwie erfreuliche Fallstudie darüber geliefert, wie wir sie entwickeln. Denn wir haben nicht nur Software für die Unternehmensführung geschrieben. Wir haben unabsichtlich ein Experiment darin durchgeführt, den Prozess zu steuern, der Software für die Unternehmensführung schreibt.

Die Akteure

Wir bauen auf Claude Code auf, dem KI-Programmierassistenten von Anthropic, einer Art Werkzeug, das sich einen Ruf erworben hat, meistens zu Recht, für "Vibe Coding": Sie beschreiben, was Sie wollen, es schreibt Code, Sie werfen einen Blick darauf, veröffentlichen ihn und hoffen auf das Beste.

Das machen wir nicht. Stattdessen läuft alles über eine Produkt-Governance-Plattform namens Ceetrix, am besten beschrieben als ein extrem strenger Projektmanager, der jedes Vertragsrechtslehrbuch gelesen hat und niemanden aus dem Raum lässt. Bevor auch nur eine einzige Zeile Code geschrieben wird, verlangt Ceetrix: Welches Problem lösen wir (das PRD), wie genau werden wir es lösen (das Design), in welche konkreten Arbeitspakete gliedert sich das (die Aufgaben), und, entscheidend, welche Tests belegen, dass jedes Teil tatsächlich funktioniert. Ceetrix lässt Sie nichts als erledigt markieren, wenn sich diese gesamte Kette nicht sauber bis zu einer echten Anforderung zurückverfolgen lässt. Keine Bauchgefühle erlaubt.

Claude Code darf also nicht frei improvisieren. Es darf entwickeln, aber nur gegen eine Spezifikation, die es nicht stillschweigend uminterpretieren kann, und es muss seine Arbeit belegen: echte Testergebnisse, echte Nachweise, echte Retrospektiven nach dem Motto „Das würde ich beim nächsten Mal anders machen“, bevor irgendetwas als fertig gilt.

Gestern: unglamourös und notwendig

Gestern haben wir zwei Bestandteile ausgeliefert, die nie einen Designpreis gewinnen werden, die aber jedes echte Unternehmen braucht: einen Einstellungen-Bildschirm, auf dem das Team auswählen kann, welches KI-Modell welche Teile des Produkts antreibt, und ein vollständiges Verwaltungssystem, um Teammitglieder einzuladen, Rollen zuzuweisen und, was wichtig ist, mit der Realität umzugehen, dass Menschen das Unternehmen verlassen. Wenn jemand, dem eine Reihe offener Risiken oder Maßnahmen gehörte, ausscheidet, lässt die Software dessen Arbeit nicht einfach verwaisen. Sie zwingt jemanden, sie ausdrücklich neu zuzuweisen. Eine Kleinigkeit. Die Art von Kleinigkeit, die, wenn sie übersprungen wird, drei Monate später zu „Moment, wessen Aufgabe war das eigentlich?“ wird.

Heute: der Software beibringen, einen Vorstand tatsächlich zur Rechenschaft zu ziehen

Das Herzstück von heute war die Funktion, die dem gesamten Produkt seine Durchsetzungskraft verleiht: Vorstandsbeschlüsse, die formellen, aktenkundigen Entscheidungen, die ein Vorstand trifft. Gestern war ein Beschluss in unserem eigenen Produkt nur ein Statusfeld, das jeder angemeldete Benutzer bearbeiten konnte. Angenommen, ausstehend, was auch immer man eingab. Heute wurde daraus etwas, das dem, was ein Beschluss in der realen Welt tatsächlich ist, näherkommt: eine Entscheidung mit Gewicht.

Hier ist, was sich geändert hat, in einfachen Worten:

  • Ein Beschluss durchläuft nun echte Phasen, Entwurf, In Prüfung, Genehmigt, Abgelehnt, und kann nur so voranschreiten, wie es bei einer echten Abstimmung der Fall wäre.
  • Um den Status Genehmigt zu erreichen, müssen zwei unterschiedliche Personen unterschreiben, nämlich der Vorstandsvorsitzende und der Gründer, nicht dieselbe Person mit zwei Hüten. Wir nennen das Funktionstrennung. Wenn sich am Beschluss auch nur geringfügig etwas ändert, sei es der Wortlaut, der Verantwortliche oder das Entscheidungsdatum, zwischen der ersten und der zweiten Unterschrift, erkennt das System dies und lässt beide erneut unterschreiben. Kein Bearbeiten eines Beschlusses, nachdem ihn jemand bereits genehmigt hat, in der Hoffnung, dass es niemand bemerkt.
  • Sobald etwas Genehmigt ist, wird es endgültig. Sie können es nicht bearbeiten. Sie können es nicht löschen. Die einzige Möglichkeit, Ihre Meinung zu ändern, besteht darin, es formell zu ersetzen, wodurch ein völlig neuer Entwurf eines Beschlusses entsteht, sichtbar mit dem verknüpft, den er ersetzt, samt einem zeitgestempelten Vermerk darüber, wer das genau getan hat und warum. Das ist der Unterschied zwischen stillem Umschreiben der Geschichte und dem Durchstreichen mit Tinte, bei dem jeder noch lesen kann, was dort einmal stand.
  • Beschlüsse können nun mit den tatsächlichen Risiken, Massnahmen und Entscheidungen verknüpft werden, auf die sie sich beziehen, sodass ein Beschluss nie isoliert für sich steht, losgelöst von der Realität, die er eigentlich behandeln sollte.

Nichts davon ist auffällig. All das macht genau den Unterschied zwischen „wir haben Vorstandsprotokolle“ und „wir haben eine Unternehmensführungsdokumentation, auf die sich ein tatsächlicher Prüfer, Erwerber oder der Anwalt eines Investors bei einer Due Diligence verlassen könnte“.

Wie es tatsächlich gebaut wurde

Bevor irgendetwas davon mit echten Daten in Berührung kam, wurde es auf vier verschiedene Arten getestet: funktioniert die zugrunde liegende Logik isoliert, funktioniert sie, wenn sie tatsächlich mit einer Datenbank kommuniziert, funktioniert sie so, wie eine Person es beim Klicken durch den Bildschirm erleben würde, und funktioniert die gesamte Abfolge, Entwurf, Einreichung, Genehmigung, erneute Genehmigung, Ersetzung, durchgehend als ein zusammenhängender Ablauf. Danach wurde es, bevor es als abgeschlossen galt, gegen eine echte, vorübergehende Kopie der tatsächlichen Datenbank getestet, mit echten Anmeldesitzungen, durch Klicken durch den echten Arbeitsablauf. Keine Simulation.

An jedem einzelnen Punkt, an dem Claude Code eine unumkehrbare Handlung hätte vornehmen können, hielt es inne und fragte zuerst nach. Vor dem Commit des Codes. Bevor er ihn irgendwohin pushte. Bevor die Produktionsdatenbank angerührt wurde. Bevor es live bereitgestellt wurde. Nicht, weil es diese Dinge technisch nicht unbeaufsichtigt hätte tun können, sondern weil genau das der eigentliche Sinn der ganzen Übung ist: eine KI, die bereitwillig schnell vorangeht, bis zu dem Moment, in dem eine Handlung nicht mehr rückgängig gemacht werden kann, und dann den Stift wieder in Ihre Hand legt.

An einer Stelle schlug die Anwendung des Datenbank-Updates auf die Produktionsumgebung mit einem kryptischen Autorisierungsfehler des Cloud-Anbieters fehl, der Art von Meldung, bei der einem für einen Moment das Herz in die Hose rutscht. Es stellte sich heraus, dass es nichts war: eine einmalige Netzwerkstörung. Dreißig Sekunden später erneut versucht, und es lief sauber durch. Ich erwähne das, weil es ein fairer Spiegel des gesamten Aufbaus ist. Das ist keine Magie, und es ist auch nicht zerbrechlich. Es ist einfach Software, die sorgfältig ist.

Warum das der springende Punkt ist

Es liegt eine echte Ironie darin, Software für Unternehmensführung zu entwickeln, ein Werkzeug, dessen gesamte Aufgabe es ist, Entscheidungen zu erzwingen, die sorgfältig, aktenkundig und nur durch einen sichtbaren, formalen Prozess umkehrbar getroffen werden, indem man einen Entwicklungsprozess verwendet, der genau das mit sich selbst tut. Jede Anforderung ist auf ein Design zurückgeführt. Jedes Design ist auf konkrete Aufgaben zurückgeführt. Jede Aufgabe wird mit tatsächlichen Testergebnissen und einem ehrlichen Hinweis darauf abgeschlossen, was beim nächsten Mal besser zu machen ist. Jede riskante, schwer rückgängig zu machende Aktion wird für ein menschliches Ja angehalten.

Darin steckt eine Lehre, die nichts speziell mit KI zu tun hat. Die Qualität der Arbeit, egal wer oder was sie ausführt, steigt in dem Moment, in dem man sich weigert, „erledigt“ etwas anderes bedeuten zu lassen als „hier ist der Beweis“. Das galt schon, bevor KI Code schreiben konnte. Wir waren stolz auf diese Disziplin in jedem Unternehmen, das ich mitgegründet habe oder an dem ich beteiligt war. Es gilt immer noch, jetzt, da KI den Code schreiben kann. Das Werkzeug hat sich geändert. Die Disziplin nicht, und das sollte auch so bleiben.

Morgen beginnen wir mit der Internationalisierung: der Funktion, die es Nutzern in mehreren Ländern ermöglicht, die Plattform in ihrer eigenen Sprache und Währung zu verwenden. Wie das läuft, erzähle ich Ihnen ebenfalls.

Lesen Sie mit? Dies ist Teil eines laufenden Entwicklungsprotokolls für die Unternehmensführungsplattform von PoseidonGrooveAI, offen entwickelt, Fehler inklusive.