ETH Zürich · Computer Vision & Geometry Group · Herbst 2025

MOBIUS goes 3D

Effiziente monokulare 3D-Objekterkennung mit Transformern, die die geschätzte Tiefe nutzen, und dichter Tiefendestillation.

KontextSemesterarbeit, Herbst 2025
PartnerGoogle Research × ETH CVG
BetreuungProf. Dr. Marc Pollefeys
BenchmarkKITTI 3D Object Detection
Python PyTorch Transformers 3D Vision
01

Qualitative Resultate

KITTI-Vorhersagen: 2D-Overlays mit IoU-Werten sowie LiDAR-Punktwolken mit Ground Truth (grün) und Vorhersagen (rot). Ziehen zum Drehen, scrollen zum Zoomen.

KITTI-2D-Erkennungsansicht

3D-Szene wird geladen…

Anzeige
02

Überblick

Monokulare 3D-Erkennung bestimmt Position, Grösse und Ausrichtung von Objekten aus einem einzigen Bild, was bezüglich Tiefe grundsätzlich mehrdeutig ist. 2D-Foundation-Models wie MOBIUS sind stark in der Erkennung mit offenem Vokabular, ihnen fehlt aber das geometrische Verständnis, das 3D verlangt.

Mit Google Research und ETH CVG (Prof. Marc Pollefeys) habe ich MOBIUS-3D entwickelt, das MOBIUS mit einem leichtgewichtigen Tiefenschätzer und einem Transformer-Decoder, der diese Tiefe nutzt, in 3D erweitert. Entscheidend ist die dichte Tiefendestillation aus dem Foundation-Model DepthPro, die präzise 3D-Erkennung ohne dichte LiDAR-Labels ermöglicht.

Die Herausforderung

2D-Modelle trainieren auf Millionen von Bildern aus Tausenden Kategorien. 3D-Datensätze sind klein, teuer zu annotieren und decken nur wenige Klassen ab. Deshalb sind 3D-Detektoren schwere, spezialisierte Modelle, die von Grund auf trainiert werden und denen das semantische Wissen der 2D-Foundation-Models fehlt.

Das Ziel: ein leichtgewichtiges 2D-Modell in 3D erweitern, ohne seine Effizienz zu verlieren, und die Annotationslücke schliessen, indem Geometrie aus einem Tiefen-Foundation-Model destilliert wird.

03

Methode

MOBIUS-3D ergänzt das eingefrorene MOBIUS-Backbone um drei Komponenten: einen Tiefenschätzer, einen Tiefen-Encoder und einen Transformer-Decoder, der die geschätzte Tiefe nutzt.

1 · Tiefenschätzer

Ein Kopf im DPT-Stil fusioniert Merkmale mehrerer Skalen zu einer dichten Tiefenkarte. Sie wird aus DepthPro destilliert, sodass jedes Pixel ein Trainingssignal erhält, nicht nur dünn besetzte LiDAR-Punkte.

2 · Tiefen-Encoder

Deformable Attention macht aus Merkmalen tiefenbewusste Tokens und tastet pro Query nur wenige Punkte statt der ganzen Karte ab: O(N·K) statt O(N²).

3 · Decoder mit Tiefeninformation

Objekt-Queries richten ihre Attention auf 3D-Positionseinbettungen. Diese entstehen, indem Pixel mit der geschätzten Tiefe und den intrinsischen Kameraparametern in den metrischen Raum projiziert werden.

Kernidee · Dichte Tiefendestillation

Monokulare Detektoren lernen die Tiefe meist aus dünn besetzten LiDAR-Daten (< 5 % der Pixel). Wir destillieren stattdessen von einem eingefrorenen DepthPro-Lehrermodell, dessen Tiefen mit der Methode der kleinsten Quadrate (Skala und Verschiebung) an LiDAR auf metrische Werte angepasst werden. Diese eine Änderung bringt in der Ablation den grössten Gewinn.

04

Resultate

KITTI 3D (Auto, IoU = 0.7). MOBIUS-3D erreicht auf jeder Schwierigkeitsstufe den besten APBEV, die wichtigste Metrik für 3D-Lokalisierung.

Methode AP3D (%) APBEV (%)
Leicht Mittel Schwer Leicht Mittel Schwer
MonoDETR 28.05 20.76 16.76 37.60 27.28 23.38
MonoDETRNext-A 32.95 25.01 21.92 - - -
MOBIUS-3D (unseres) 31.92 24.22 22.58 41.83 31.64 30.04

Ablation: Trainingssignal für die Tiefe

Das Trainingssignal für die Tiefe ist die wirkungsvollste Designentscheidung, und dichte Destillation gewinnt durchwegs.

Trainingssignal Tiefe AP3D (%) APBEV (%)
Leicht Mittel Schwer Leicht Mittel Schwer
Keine 19.39 12.16 10.31 31.79 22.12 19.30
Nur auf Objektebene 17.35 11.10 10.25 27.52 18.70 17.86
Dünn besetztes LiDAR 23.15 16.69 15.54 31.42 23.93 22.15
Dichte Destillation (unsere) 31.92 24.22 22.58 41.83 31.64 30.04