Posts

Posts mit dem Label "Realität" werden angezeigt.

Wie lernt eine KI "Sehen"?

 Damit eine KI – etwa in einem autonomen Auto oder einem Roboter – Videobilder zur Selbststeuerung nutzen kann, muss sie den zweidimensionalen Pixelstrom in ein dreidimensionales Verständnis der Welt übersetzen. Dieser Prozess wird oft als Computer Vision bezeichnet. Hier sind die entscheidenden Schritte, wie aus bunten Punkten auf einem Sensor eine Handlungsanweisung wird: 1. Objekterkennung und Klassifizierung Zuerst muss die KI wissen, was sie sieht. Ein neuronales Netz analysiert jedes Einzelbild (Frame) des Videos. Bounding Boxes: Die KI zieht Rahmen um erkannte Objekte (z. B. „Fußgänger“, „Stoppschild“, „Baustelle“). Semantische Segmentierung: Hier geht die KI tiefer und ordnet jedem einzelnen Pixel eine Kategorie zu. So weiß sie genau, wo der „Asphalt“ aufhört und der „Bürgersteig“ beginnt. 2. Tiefenschätzung und 3D-Rekonstruktion Ein Videobild ist flach, aber Steuerung findet im Raum statt. Die KI muss Distanzen berechnen: Stereo-Vision: Wenn zwei Kameras vorhanden sin...