Anna gegen die große KI: 4 von 14
Wer etwas baut, das langsamer ist als die Konkurrenz, sollte wenigstens ehrlich messen, wie viel langsamer. Deshalb habe ich für Anna einen Prüfstand gebaut.
Der Versuch
Es gibt drei kurze Texte über eine erfundene Familie: einen Steckbrief, eine Familiennotiz und eine Wochennotiz. Wer sie gelesen hat, sollte vierzehn Dinge wissen, zum Beispiel diese:
- Jonas wohnt in Leipzig und arbeitet bei Kranich Logistik.
- Er ist mit Miriam verheiratet, und Paul ist Miriams Bruder.
- Clara und Ben sind Jonas' Kinder. Clara ist nicht Pauls Tochter.
- Miriam gibt Clara ein Buch. Jonas wohnt nicht mehr in Leipzig.
Die Texte lesen zwei: Anna auf dem iPhone, ohne Internet und mit ihrer handgeschriebenen Grammatik, und eine große KI, ein Sprachmodell in der Cloud. Ein Programm zählt, was jede davon richtig in ihr Gedächtnis schreibt. Es zählt auch, was sie falsch hineinschreibt.
Anna: von 1 auf 4
Bei der ersten Messung am 26.9. kam Anna auf 1 von 14, und diesen einen Punkt bekam sie für einen Fehler, den sie nicht gemacht hat. Viele Sätze beantwortete sie mit „Moin!“, weil ihre Satzerkennung sie für eine Begrüßung hielt.
Zwei Tage später steht sie bei 4 von 14, und sie hat bis heute in keiner Messung etwas Falsches eingetragen. Wo sie nicht weiterkommt, sagt sie das inzwischen auch:
„Clara ist die Tochter von Jonas.“
Anna: „Wessen ‚Tochter‘ gemeint ist, verstehe ich in einer Aussage noch nicht. Ich habe nichts gespeichert.“
„Jonas arbeitet bei Kranich Logistik.“
Anna: „Das sind mir zu viele Beteiligte – ‚Logistik‘ bekomme ich noch nicht unter. Sag es mir bitte in zwei Sätzen, dann halte ich beides fest.“
Beides ist kein Treffer, aber beides stimmt. Anna rät nicht, sie sagt, was ihr fehlt, und die Zahl ihrer Rückfragen ist von 15 auf 8 gesunken.
Wir haben auf den Test trainiert, aus Versehen
Diesen Teil hätte ich lieber nicht geschrieben.
Am 28.9. fiel uns beim Nachprüfen auf, dass zwei Tage vorher Trainingsbeispiele ins Programm gekommen waren, die den Prüfstand-Sätzen verdächtig ähnlich sahen. Ein Test, auf den man trainiert, misst nur noch sich selbst. Also haben wir alle diese Beispiele entfernt und neu gemessen.
Ergebnis: weiter 4 von 14, weiter 0 Fehler. Die Zahl war verdient, der Weg dorthin war es nicht ganz. Seitdem gilt eine feste Regel: Auf dem Prüfstand wird nur gemessen, nie geübt.
Und die große KI?
Dieselben drei Texte gingen an ein großes Sprachmodell (Claude). Die KI kam auf 12 von 14 und liegt damit deutlich vorn, wie erwartet.
Interessanter ist, was sie ins Gedächtnis geschrieben hat:
„Clara ist nicht die Tochter von Paul.“
KI: Clara – isNotDaughterOf – Paul
Hier hat sie eine neue Beziehung erfunden, „ist-nicht-Tochter-von“. Das klingt richtig, ist aber keine Verneinung.
„Jonas wohnt nicht mehr in Leipzig.“
KI: Jonas – formerlyLivedIn – Leipzig
Das ist klug gelesen. Weil aber „Jonas wohnt in Leipzig“ aus dem ersten Text im Speicher stehen bleibt, wohnt Jonas jetzt gleichzeitig dort und nicht mehr dort.
„Miriam gibt Clara ein Buch.“
KI: Miriam – gives – Buch und Miriam – givesTo – Clara
Aus diesen zwei losen Aussagen lässt sich nicht mehr zusammensetzen, wer wem was gegeben hat.
| Treffer | etwas Falsches geschrieben | |
|---|---|---|
| große KI (26.9.) | 12 von 14 | 4 erfundene Beziehungen, 1 Widerspruch, 1 doppelte Person |
| Anna (28.9.) | 4 von 14 | nichts |
Ehrlich gesagt liegt das auch an uns. Die große KI bekommt von fak10 nicht nur den Text, sondern auch ein Protokoll, das ihr vorgibt, wie sie Fakten aufschreiben soll. Als sie gemessen wurde, gab es darin kein Feld für ein „nicht“. Also hat sie getan, was jeder an ihrer Stelle getan hätte, und sich ein Wort ausgedacht. Inzwischen haben wir das Protokoll mehrmals überarbeitet. Die nächste Folge zeigt, was die KI damit schafft.
Worum es geht
Die große KI versteht mehr, daran gibt es keinen Zweifel. Anna schreibt heute wenig, aber nichts Falsches. Beides messen wir weiter, offen und mit denselben Texten. Die Frage dieser Serie ist deshalb nicht, ob Anna die große KI einholt, sondern wie weit man ohne Cloud, ohne Raten und ohne Rechenzentrum kommt, ohne je etwas Falsches zu schreiben.
Mein Ziel bis zum Launch sind 10 von 14. Die nächste Folge kommt, wenn sich die Zahl bewegt hat.
— Maciek
Wenn du dabei sein willst, wenn fak10 erscheint: Zur Warteliste