Ein Kopf im DPT-Stil fusioniert Merkmale mehrerer Skalen zu einer dichten Tiefenkarte. Sie wird aus DepthPro destilliert, sodass jedes Pixel ein Trainingssignal erhält, nicht nur dünn besetzte LiDAR-Punkte.
Qualitative Resultate
KITTI-Vorhersagen: 2D-Overlays mit IoU-Werten sowie LiDAR-Punktwolken mit Ground Truth (grün) und Vorhersagen (rot). Ziehen zum Drehen, scrollen zum Zoomen.
3D-Szene wird geladen…
Überblick
Monokulare 3D-Erkennung bestimmt Position, Grösse und Ausrichtung von Objekten aus einem einzigen Bild, was bezüglich Tiefe grundsätzlich mehrdeutig ist. 2D-Foundation-Models wie MOBIUS sind stark in der Erkennung mit offenem Vokabular, ihnen fehlt aber das geometrische Verständnis, das 3D verlangt.
Mit Google Research und ETH CVG (Prof. Marc Pollefeys) habe ich MOBIUS-3D entwickelt, das MOBIUS mit einem leichtgewichtigen Tiefenschätzer und einem Transformer-Decoder, der diese Tiefe nutzt, in 3D erweitert. Entscheidend ist die dichte Tiefendestillation aus dem Foundation-Model DepthPro, die präzise 3D-Erkennung ohne dichte LiDAR-Labels ermöglicht.
Die Herausforderung
2D-Modelle trainieren auf Millionen von Bildern aus Tausenden Kategorien. 3D-Datensätze sind klein, teuer zu annotieren und decken nur wenige Klassen ab. Deshalb sind 3D-Detektoren schwere, spezialisierte Modelle, die von Grund auf trainiert werden und denen das semantische Wissen der 2D-Foundation-Models fehlt.
Das Ziel: ein leichtgewichtiges 2D-Modell in 3D erweitern, ohne seine Effizienz zu verlieren, und die Annotationslücke schliessen, indem Geometrie aus einem Tiefen-Foundation-Model destilliert wird.
Methode
MOBIUS-3D ergänzt das eingefrorene MOBIUS-Backbone um drei Komponenten: einen Tiefenschätzer, einen Tiefen-Encoder und einen Transformer-Decoder, der die geschätzte Tiefe nutzt.
Deformable Attention macht aus Merkmalen tiefenbewusste Tokens und tastet pro Query nur wenige Punkte statt der ganzen Karte ab: O(N·K) statt O(N²).
Objekt-Queries richten ihre Attention auf 3D-Positionseinbettungen. Diese entstehen, indem Pixel mit der geschätzten Tiefe und den intrinsischen Kameraparametern in den metrischen Raum projiziert werden.
Monokulare Detektoren lernen die Tiefe meist aus dünn besetzten LiDAR-Daten (< 5 % der Pixel). Wir destillieren stattdessen von einem eingefrorenen DepthPro-Lehrermodell, dessen Tiefen mit der Methode der kleinsten Quadrate (Skala und Verschiebung) an LiDAR auf metrische Werte angepasst werden. Diese eine Änderung bringt in der Ablation den grössten Gewinn.
Resultate
KITTI 3D (Auto, IoU = 0.7). MOBIUS-3D erreicht auf jeder Schwierigkeitsstufe den besten APBEV, die wichtigste Metrik für 3D-Lokalisierung.
| Methode | AP3D (%) | APBEV (%) | ||||
|---|---|---|---|---|---|---|
| Leicht | Mittel | Schwer | Leicht | Mittel | Schwer | |
| MonoDETR | 28.05 | 20.76 | 16.76 | 37.60 | 27.28 | 23.38 |
| MonoDETRNext-A | 32.95 | 25.01 | 21.92 | - | - | - |
| MOBIUS-3D (unseres) | 31.92 | 24.22 | 22.58 | 41.83 | 31.64 | 30.04 |
Ablation: Trainingssignal für die Tiefe
Das Trainingssignal für die Tiefe ist die wirkungsvollste Designentscheidung, und dichte Destillation gewinnt durchwegs.
| Trainingssignal Tiefe | AP3D (%) | APBEV (%) | ||||
|---|---|---|---|---|---|---|
| Leicht | Mittel | Schwer | Leicht | Mittel | Schwer | |
| Keine | 19.39 | 12.16 | 10.31 | 31.79 | 22.12 | 19.30 |
| Nur auf Objektebene | 17.35 | 11.10 | 10.25 | 27.52 | 18.70 | 17.86 |
| Dünn besetztes LiDAR | 23.15 | 16.69 | 15.54 | 31.42 | 23.93 | 22.15 |
| Dichte Destillation (unsere) | 31.92 | 24.22 | 22.58 | 41.83 | 31.64 | 30.04 |