Forschung & Werkzeuge
Benchmark-Datensatz-Verzeichnis
Ein quelloffener Index darüber, wo die öffentlichen Tracking- und Wahrnehmungs-Benchmarks
tatsächlich liegen — damit ein erneuter Download später nicht bedeutet, eine funktionierende
Quelle von Grund auf neu zu suchen.
Worum es sich handelt
Ein Verweisverzeichnis, kein Datensatz-Spiegel.
Validierung über mehrere Benchmarks hinweg ist zentral dafür, wie Perception Origin seine
Wahrnehmungssoftware misst — Trefferquote bei Verweildauer und Anwesenheit unter
Personendichte, Robustheit des Trackings und allgemeine Forschung zu Multi-Object-Tracking
stützen sich auf öffentliche akademische Benchmarks (MOT17, MOT20, PETS2009, CrowdHuman,
DanceTrack, die Familie aus KITTI/nuScenes/Waymo und weitere). Mehrere der
ursprünglichen Hosts dieser Benchmarks sind tot, langsam oder umgezogen — eine
funktionierende Quelle zu finden, hat jedes Mal echte Arbeit gekostet. Das
Benchmark-Datensatz-Verzeichnis
ist genau diese Arbeit, gesichert und aktuell gehalten: Abrufskripte, exakte Quell-URLs und
Lizenzhinweise zu jedem der 30 öffentlichen Datensätze. Das Verzeichnis enthält
selbst keine Datensatzdateien — nur das Rezept, an jeden einzelnen zu kommen, und
eine ehrliche Aufzeichnung darüber, was tatsächlich verifiziert ist und was lediglich ein
erreichbarer Kandidat.
Warum es existiert
Gebaut für Menschen — und für die KI-Forschungswerkzeuge, die diese Arbeit
zunehmend übernehmen.
Schluss mit dem Wiederfinden toter Links
Akademische Datensatz-Hosts verfallen. Ein Verzeichnis, das festhält, was tatsächlich
funktioniert hat — und einen veralteten Pfad an Ort und Stelle korrigiert —, schlägt die
Suche bei null, jedes Mal wenn ein Benchmark erneut laufen soll.
Ehrlicher Status statt Optimismus
Jeder Eintrag ist als verifiziert, Kandidat, registrierungspflichtig oder unbestätigt
gekennzeichnet — keine erfundenen Download-Pfade und kein Beschönigen von Datensätzen, die
eine Lizenzvereinbarung verlangen, welche das Verzeichnis für niemanden unterschreiben
kann.
Lesbar für KI-Forschungsagenten
Zunehmend ist es kein Mensch, der ein solches Verzeichnis auf GitHub durchsieht, sondern
ein KI-Agent (Claude, GPT und andere), der einen Benchmark-Lauf plant. Das Verzeichnis ist
so geschrieben, dass ein Agent den Eintrag eines Datensatzes lesen, den hinterlegten Pfad
nutzen und ihn — falls er inzwischen tot ist — an Ort und Stelle korrigieren kann, statt
ihn still in einer Sitzung zu umgehen und die nächste dieselbe Sackgasse erneut entdecken
zu lassen.
Lizenzen ernst genommen
Die tatsächlichen Bedingungen jedes Datensatzes sind dokumentiert — einschließlich
Datensätzen, die aus ethischen Gründen bewusst ausgeschlossen sind (siehe die Anmerkungen
des Verzeichnisses dazu, warum DukeMTMC nicht gelistet ist), und solchen, die eine
Registrierung direkt beim Herausgeber verlangen, für die es kein automatisches Abrufskript
gibt und auch keines geben wird.
Das Verzeichnis
Öffentlich, zum Lesen ist kein Konto nötig.