Methode & Transparenz

Wie zuverlässig ist das Modell wirklich?

Wir zeigen die echten Zahlen — Trainings-Daten, Validierung, Modell-Iterationen, bekannte Schwächen. Kein Marketing-Spin auf der Accuracy. Ein erkannter Fehler bei einer übertriebenen Behauptung kostet mehr Vertrauen als die Behauptung einbringt.

Aktuelle Performance — Ralph Lauren · Neck-Label
98 %
auf entschiedenen Fällen · Out-of-Fold · n = 1.640 · Modell v6

Das Live-Modell (v6, 3-Seed-Ensemble bei 448 px) erreicht AUC 0,9933; die zertifizierte Fehlerschranke liegt bei ≤ 3,2 % bei 95 % Konfidenz. Und ganz bewusst: Bei rund 6 % der Fälle sagt das Modell ehrlich „nicht eindeutig", statt zu raten. Diese Checks kosten nichts, eingesetzte Credits kommen automatisch zurück. Die 98 % gelten für die Fälle, in denen das Modell ein Urteil abgibt.

Trainings-Daten

  • 10.029 Ralph-Lauren-Neck-Label-Bilder, alle manuell von uns + Moderatoren auf echt/fake verifiziert.
  • Quellen: Discord-Reseller-Communities (öffentlich gepostete Verdicts) + kuratierte Yupoo/Reps-Scrape-Pools. Keine User-Uploads von zahlenden Kunden im Trainings-Set.
  • Mehrere Mod-Audit-Iterationen mit blindem Re-Labeling — flippte Labels gehen zurück ins Trainings-Set, „unsure" landet in einem separaten Review-Pool.
  • Nach dem Cleaning eindeutiger Müll-Bilder (Screenshots, Foto-vom-Foto): ~9.900 Bilder im Trainings-Set (~5.350 real / 4.540 fake). Unsichere Kundenfälle werden von Prüfpersonen nachbeurteilt und erweitern das Set laufend.

Validierungs-Setup

5-fold Cross-Validation auf dem gesamten Trainings-Set — jedes Bild ist in genau einer Fold im Holdout und wird vom Modell vorhergesagt, das es nie gesehen hat. Das ist die ehrlichste Schätzung der Real-World-Performance ohne separates Test-Set. Zusätzlich: stratified 15 %-Test-Holdout (Seed 42) für direkten Modell-vs-Modell-Vergleich.

Backbone: SSL-adaptierter DINOv3 ViT-B/16 (Meta), auf ~66k Neck-Bildern vortrainiert. Das Live-Modell v6 rechnet bei 448 px Eingabegröße (höhere Auflösung brachte gemessen mehr als ein größerer Backbone) als 3-Seed-Ensemble mit Temperature-Scaling. Unsichere Scores landen in einem Abstain-Band und werden als „nicht eindeutig" ausgewiesen statt geraten, mit automatischer Erstattung.

Bekannte Schwächen — was wir noch nicht gut können

  • Cross-Brand-Generalisierung fehlt: das Modell ist nur für Ralph Lauren (Neck-Label) trainiert. Andere Marken brauchen je eigene Modelle (Industry-Standard, vgl. Vestiaire Academy, Lacoste-Paper arXiv 2410.05969). Adidas ist als nächste Marke in Arbeit, die Trainingsdaten sind bereits verifiziert.
  • Super-Fakes: moderne Reps mit sehr gut nachgebildeten Markern (richtige Stickerei, richtige Schrift). Hier liegen wir häufiger daneben, solche Fälle landen überdurchschnittlich oft im „nicht eindeutig"-Band.
  • Sehr kleine Bilder: unter 128 px kürzester Kante lehnen wir das Foto ab. Darüber ist die Trefferquote auf unserem Gold-Set gemessen stabil (Test vom 24.08.), unscharfe Bilder fängt ein eigenes Gate. Für kritische Käufe trotzdem: scharfes Foto, Label formatfüllend.
  • Label-Noise: Mislabels im Trainings-Set begrenzen jede erreichbare Genauigkeit. Mehrere Audit-Runden (OOF + FINE + WANN + AUM) haben die Decke seit v3 spürbar gehoben, v6 steht bei AUC 0,9933. Rest-Noise bleibt der limitierende Faktor, deshalb die ehrliche Enthaltung statt erzwungener Urteile.

Modell-Lineage — was wir gelernt haben

Nicht jedes Update macht das Modell besser. Wir dokumentieren auch die Sackgassen.

IterationSetupTest-Acc
v1SSL-Backbone 66k, BCE-Loss~95 %
v2SSL-Backbone 141k (mehr Daten), STN-Align94,2 % (−1pp)
v3 (neu)Zurück auf 66k-Backbone, cleaned Set95,6 % (+0,5pp)
v3-JALJAL-Loss statt BCE93,5-94,9 % (verworfen)
v6 (live)448 px, 3-Seed-Ensemble, Abstain-Band98,1 % (entschiedene Fälle, AUC 0,9933)

Befund: bei niedrigem Label-Noise schadet ein noise-robuster Loss (JAL) mehr als er hilft — Underfitting frisst den Robustheits-Gewinn. „Mehr SSL-Daten = besser“ gilt auch nicht blind: naives Continued-Pretraining > 20-30k Bilder ohne DIET-CP-Recipe degradiert die Features (dokumentiert in DINOv3-Maintainer-Posts).

Fragen zur Methodik? Schreib uns. Wir antworten ehrlich, auch zu Limitationen.

Jetzt prüfen