Wie zuverlässig ist das Modell wirklich?
Wir zeigen die echten Zahlen — Trainings-Daten, Validierung, Modell-Iterationen, bekannte Schwächen. Kein Marketing-Spin auf der Accuracy. Ein erkannter Fehler bei einer übertriebenen Behauptung kostet mehr Vertrauen als die Behauptung einbringt.
Das Live-Modell (v6, 3-Seed-Ensemble bei 448 px) erreicht AUC 0,9933; die zertifizierte Fehlerschranke liegt bei ≤ 3,2 % bei 95 % Konfidenz. Und ganz bewusst: Bei rund 6 % der Fälle sagt das Modell ehrlich „nicht eindeutig", statt zu raten. Diese Checks kosten nichts, eingesetzte Credits kommen automatisch zurück. Die 98 % gelten für die Fälle, in denen das Modell ein Urteil abgibt.
Trainings-Daten
- 10.029 Ralph-Lauren-Neck-Label-Bilder, alle manuell von uns + Moderatoren auf echt/fake verifiziert.
- Quellen: Discord-Reseller-Communities (öffentlich gepostete Verdicts) + kuratierte Yupoo/Reps-Scrape-Pools. Keine User-Uploads von zahlenden Kunden im Trainings-Set.
- Mehrere Mod-Audit-Iterationen mit blindem Re-Labeling — flippte Labels gehen zurück ins Trainings-Set, „unsure" landet in einem separaten Review-Pool.
- Nach dem Cleaning eindeutiger Müll-Bilder (Screenshots, Foto-vom-Foto): ~9.900 Bilder im Trainings-Set (~5.350 real / 4.540 fake). Unsichere Kundenfälle werden von Prüfpersonen nachbeurteilt und erweitern das Set laufend.
Validierungs-Setup
5-fold Cross-Validation auf dem gesamten Trainings-Set — jedes Bild ist in genau einer Fold im Holdout und wird vom Modell vorhergesagt, das es nie gesehen hat. Das ist die ehrlichste Schätzung der Real-World-Performance ohne separates Test-Set. Zusätzlich: stratified 15 %-Test-Holdout (Seed 42) für direkten Modell-vs-Modell-Vergleich.
Backbone: SSL-adaptierter DINOv3 ViT-B/16 (Meta), auf ~66k Neck-Bildern vortrainiert. Das Live-Modell v6 rechnet bei 448 px Eingabegröße (höhere Auflösung brachte gemessen mehr als ein größerer Backbone) als 3-Seed-Ensemble mit Temperature-Scaling. Unsichere Scores landen in einem Abstain-Band und werden als „nicht eindeutig" ausgewiesen statt geraten, mit automatischer Erstattung.
Bekannte Schwächen — was wir noch nicht gut können
- Cross-Brand-Generalisierung fehlt: das Modell ist nur für Ralph Lauren (Neck-Label) trainiert. Andere Marken brauchen je eigene Modelle (Industry-Standard, vgl. Vestiaire Academy, Lacoste-Paper arXiv 2410.05969). Adidas ist als nächste Marke in Arbeit, die Trainingsdaten sind bereits verifiziert.
- Super-Fakes: moderne Reps mit sehr gut nachgebildeten Markern (richtige Stickerei, richtige Schrift). Hier liegen wir häufiger daneben, solche Fälle landen überdurchschnittlich oft im „nicht eindeutig"-Band.
- Sehr kleine Bilder: unter 128 px kürzester Kante lehnen wir das Foto ab. Darüber ist die Trefferquote auf unserem Gold-Set gemessen stabil (Test vom 24.08.), unscharfe Bilder fängt ein eigenes Gate. Für kritische Käufe trotzdem: scharfes Foto, Label formatfüllend.
- Label-Noise: Mislabels im Trainings-Set begrenzen jede erreichbare Genauigkeit. Mehrere Audit-Runden (OOF + FINE + WANN + AUM) haben die Decke seit v3 spürbar gehoben, v6 steht bei AUC 0,9933. Rest-Noise bleibt der limitierende Faktor, deshalb die ehrliche Enthaltung statt erzwungener Urteile.
Modell-Lineage — was wir gelernt haben
Nicht jedes Update macht das Modell besser. Wir dokumentieren auch die Sackgassen.
| Iteration | Setup | Test-Acc |
|---|---|---|
| v1 | SSL-Backbone 66k, BCE-Loss | ~95 % |
| v2 | SSL-Backbone 141k (mehr Daten), STN-Align | 94,2 % (−1pp) |
| v3 (neu) | Zurück auf 66k-Backbone, cleaned Set | 95,6 % (+0,5pp) |
| v3-JAL | JAL-Loss statt BCE | 93,5-94,9 % (verworfen) |
| v6 (live) | 448 px, 3-Seed-Ensemble, Abstain-Band | 98,1 % (entschiedene Fälle, AUC 0,9933) |
Befund: bei niedrigem Label-Noise schadet ein noise-robuster Loss (JAL) mehr als er hilft — Underfitting frisst den Robustheits-Gewinn. „Mehr SSL-Daten = besser“ gilt auch nicht blind: naives Continued-Pretraining > 20-30k Bilder ohne DIET-CP-Recipe degradiert die Features (dokumentiert in DINOv3-Maintainer-Posts).
Fragen zur Methodik? Schreib uns. Wir antworten ehrlich, auch zu Limitationen.