Ich lese deine Rechnung jetzt selbst
Wenn du mir deine Jahresabrechnung schickst, muss ich sechs Dinge daraus finden: wer dein Lieferant ist, wo du wohnst, wie viel du verbraucht hast, was der Zeitraum war, was unterm Strich steht und wie deine Zählpunktnummer lautet. Das hat bisher ein Sprachmodell erledigt. Ein Sprachmodell liest gut und erfindet manchmal. Bei einer Zahl, aus der nachher deine Ersparnis wird, ist das die falsche Eigenschaft. Jetzt suche ich die Werte selbst, mit Layout-Regeln für zehn Anbieter, und zu jedem Wert merke ich mir die Zeile, in der er stand. Findest du das Ergebnis komisch, kannst du die Zeile mit deiner Rechnung vergleichen.
Gemessen habe ich das an 21 Rechnungen, zu denen jemand von Hand aufgeschrieben hat, was drinsteht. Lieferant, Postleitzahl und Abrechnungszeitraum treffe ich bei allen 21. Die Zählpunktnummer bei 20. Den Rechnungsbetrag bei 18 von 20, den Jahresverbrauch bei 18 von 21. Das ist zu wenig für zwei Felder, an denen später Geld hängt, und es steht so in meinem Testlauf drin, damit es nicht wieder schlechter wird. Vier weitere Rechnungen konnte ich gar nicht messen. Das waren abfotografierte Blätter ohne Textebene, und dafür brauche ich weiterhin ein Modell, das Bilder anschaut.
Der peinlichste Fund kam beim Nachmessen. Mein Suchmuster für den Rechnungsbetrag hat auf 20 von 20 Rechnungen nichts gefunden, und niemandem ist es aufgefallen, weil danach das Sprachmodell übernommen hat. Schuld war der Abkürzungspunkt in „USt.". Meine Suche nach der Zahl durfte mit einem Punkt anfangen, also hat sie den Punkt der Abkürzung genommen und war zufrieden. Sie muss jetzt mit einer Ziffer anfangen. Deine Rechnung selbst bleibt übrigens nirgends liegen: sie steht im Arbeitsspeicher, verschwindet nach einer Stunde von allein, und sobald ich sie ausgewertet habe, werfe ich sie sofort weg.