Forschung & Werkzeuge

Benchmark-Datensatz-Verzeichnis

Ein quelloffener Index darüber, wo die öffentlichen Tracking- und Wahrnehmungs-Benchmarks tatsächlich liegen — damit ein erneuter Download später nicht bedeutet, eine funktionierende Quelle von Grund auf neu zu suchen.

Worum es sich handelt

Ein Verweisverzeichnis, kein Datensatz-Spiegel.

Validierung über mehrere Benchmarks hinweg ist zentral dafür, wie Perception Origin seine Wahrnehmungssoftware misst — Trefferquote bei Verweildauer und Anwesenheit unter Personendichte, Robustheit des Trackings und allgemeine Forschung zu Multi-Object-Tracking stützen sich auf öffentliche akademische Benchmarks (MOT17, MOT20, PETS2009, CrowdHuman, DanceTrack, die Familie aus KITTI/nuScenes/Waymo und weitere). Mehrere der ursprünglichen Hosts dieser Benchmarks sind tot, langsam oder umgezogen — eine funktionierende Quelle zu finden, hat jedes Mal echte Arbeit gekostet. Das Benchmark-Datensatz-Verzeichnis ist genau diese Arbeit, gesichert und aktuell gehalten: Abrufskripte, exakte Quell-URLs und Lizenzhinweise zu jedem der 30 öffentlichen Datensätze. Das Verzeichnis enthält selbst keine Datensatzdateien — nur das Rezept, an jeden einzelnen zu kommen, und eine ehrliche Aufzeichnung darüber, was tatsächlich verifiziert ist und was lediglich ein erreichbarer Kandidat.

Warum es existiert

Gebaut für Menschen — und für die KI-Forschungswerkzeuge, die diese Arbeit zunehmend übernehmen.

Schluss mit dem Wiederfinden toter Links

Akademische Datensatz-Hosts verfallen. Ein Verzeichnis, das festhält, was tatsächlich funktioniert hat — und einen veralteten Pfad an Ort und Stelle korrigiert —, schlägt die Suche bei null, jedes Mal wenn ein Benchmark erneut laufen soll.

Ehrlicher Status statt Optimismus

Jeder Eintrag ist als verifiziert, Kandidat, registrierungspflichtig oder unbestätigt gekennzeichnet — keine erfundenen Download-Pfade und kein Beschönigen von Datensätzen, die eine Lizenzvereinbarung verlangen, welche das Verzeichnis für niemanden unterschreiben kann.

Lesbar für KI-Forschungsagenten

Zunehmend ist es kein Mensch, der ein solches Verzeichnis auf GitHub durchsieht, sondern ein KI-Agent (Claude, GPT und andere), der einen Benchmark-Lauf plant. Das Verzeichnis ist so geschrieben, dass ein Agent den Eintrag eines Datensatzes lesen, den hinterlegten Pfad nutzen und ihn — falls er inzwischen tot ist — an Ort und Stelle korrigieren kann, statt ihn still in einer Sitzung zu umgehen und die nächste dieselbe Sackgasse erneut entdecken zu lassen.

Lizenzen ernst genommen

Die tatsächlichen Bedingungen jedes Datensatzes sind dokumentiert — einschließlich Datensätzen, die aus ethischen Gründen bewusst ausgeschlossen sind (siehe die Anmerkungen des Verzeichnisses dazu, warum DukeMTMC nicht gelistet ist), und solchen, die eine Registrierung direkt beim Herausgeber verlangen, für die es kein automatisches Abrufskript gibt und auch keines geben wird.

Das Verzeichnis

Öffentlich, zum Lesen ist kein Konto nötig.

Auf GitHub ansehen →

halfwinddev/manasaview-benchmark-datasets — Abrufskripte, Quellenangaben und LICENSE-NOTES.md für MOT17/MOT20/PETS2009, DanceTrack, CrowdHuman, SportsMOT, VisDrone, WildTrack, die Familie aus KITTI/nuScenes/Waymo/BDD100K/Argoverse 2, Ego4D/Ego-Exo4D und weitere.