Sagen Sie nicht „fertig“ ohne Messung: 1641 Tests für eine persönliche Website.
Jede Behauptung dieser Site hat einen Test: von der Kontrasttabelle bis zum Layout-Shift beim Scrollen, von der Tastatur-Tour bis zum Textabschneiden in drei Sprachen. Die Regel ist ein Satz: Ein Screenshot ist kein Beweis.
Die Suite fährt heute 1641 Messungen: Jede der 57 Routen durchläuft acht Prüfungen, der Reduced-Motion-Fluss wird eigens gemessen — und ebenso der Gegenbeweis, dass Motion wirklich läuft. Der Gegenbeweis zählt: Ein Test „ruhig, wenn Motion aus ist“ wird auch grün, wenn Motion nie gebaut wurde — ein lügendes Grün.
- node tools/verify.mjs 4173
- …
- 1641 bestanden · 0 offen · gesamt 1641
Warum das Auge nicht genügt
Vier echte Fälle. Erstens — in einer eingebetteten Vorschau hielt sich der Tab stets für „verborgen“; die Animation lief zu Ende, ohne dass jemand hinsah, und auf dem Bildschirm blieb nur das letzte Bild. Die Messung lehrte, die Choreografie an den Frame-Fluss zu binden, nicht an die Sichtbarkeit. Zweitens — der Layout-Shift beim Laden lag bei 0,027, alle waren beruhigt; der erste Test, der die Scroll-Phase maß, fand 0,74. Drittens — das Urteil „diese Variable liest niemand“ beruhte auf einer abgeschnittenen Suchausgabe; die Browser-Messung zeigte, dass die Kette sehr lebendig war.
Viertens, und am lehrreichsten: Auf Mobilgeräten überschritten zwei Routen das Shift-Budget, und die Schuld ging direkt an den Signature-Effekt. Die Diagnose war plausibel — der Effekt verändert tatsächlich die Textbreite. Die Messung widerlegte sie. Der Shift geschah bei 2071 ms, die Schriftdatei war bei 2046 ms fertig: Diese fünfundzwanzig Millisekunden waren kein Zufall. Die Quelle war nicht der Effekt, sondern der Schriftwechsel.
Der Preis dieses Falls ist zählbar. Die vorgeschlagene Lösung lautete „den Effekt auf Mobilgeräten einfrieren“ — angewandt hätte sie den Shift NICHT behoben, sondern nur das Signature-Element mobil getötet. Die Messung hat hier also keinen Fehler korrigiert; sie hat eine falsche Korrektur verhindert. Wie plausibel eine Diagnose auch aussieht: Kein Urteil, bevor die Zeitstempel nebeneinanderliegen.
Die Aufgabe eines Tests ist nicht, zu bestehen
Die Aufgabe eines Tests ist, dass nie wieder jemand von Hand nachsehen muss. Jede Korrektur hinterlässt eine Wache in der Suite: Kehrt derselbe Fehler zurück, wird es rot, bevor ein menschliches Auge es sieht. Auch der Schriftfall hinterließ eine — die Suite verzögert die woff2-Datei nun absichtlich und misst auf vier Routen, dass sich die Überschriftenhöhe im Moment des Wechsels nicht ändert. Geprüft wird nicht der Fehler selbst, sondern die BEDINGUNG, die ihn erzeugt hat.
Manche Wachen arbeiten in die Gegenrichtung. In der Schema-Schicht ist das Feld sameAs bewusst leer, und ein Test sorgt dafür, dass sich kein erfundenes Profil einschleicht. Ebenso beim Preisfeld. Diese messen nicht, dass etwas FUNKTIONIERT, sondern dass etwas NICHT GETAN wurde — und mit der Zeit erweisen sie sich als die nützlichsten, denn erfundene Angaben kommen leise.
Behauptungsdrift
Auch dieser Artikel wird geprüft. Die Zahl 1641 oben wurde nicht von Hand getippt: Die Suite vergleicht den Wert im veröffentlichten HTML mit ihrer eigenen realen Summe. Kommt ein Test hinzu, veraltet dieser Absatz und die Suite wird rot — womit die Aktualisierung des Artikels verpflichtend wird. Die Reibung ist gewollt.
Warum es diese Wache gibt, wurde genau in dieser Runde sichtbar. Der Schema-Artikel sagte „aus fünf Typen gebaut“; die SEO-Runde brachte den Graphen auf elf, und der Satz war plötzlich falsch. Der llms.txt-Artikel sagte „die Datei hat neun Zeilen“; die Datei war gewachsen. Beides wurde korrigiert — aber keines fing sich selbst; ein menschliches Auge fand sie. Der nächste Schritt liegt auf der Hand: eine Wache für jede Behauptung, die eine Zahl trägt.
Beweis ist das, was sich wiederholen lässt.