
Episode #6
Wie funktioniert OCR? - Wie Maschinen Dokumente lesen
Was passiert eigentlich, wenn ihr eine Rechnung abfotografiert und ein System daraus automatisch Kundennummer und Betrag zieht? Optical Character Recognition (OCR) ist dabei nur ein Schritt. Moderne Dokumentenverarbeitung ist eine ganze Pipeline: Bildvorverarbeitung, Texterkennung, Layout-Analyse, Zeichenerkennung und schliesslich ein Transformer-Modell, das die wahrscheinlichste Textsequenz bestimmt. In dieser Folge von „KI kurz und informativ" erkläre ich, wie OCR technisch funktioniert: warum CNNs und Vision Transformer dafür eingesetzt werden, warum moderne Systeme nicht mehr Buchstabe für Buchstabe lesen, sondern ganze Sequenzen und warum sich damit zwar Fehler korrigieren lassen. Themen dieser Folge: Was OCR technisch macht Von der Zeichen- zur Sequenzerkennung Was Transformer damit zu tun haben Warum synthetische Trainingsdaten bei OCR gut funktionieren Die typische OCR-Pipeline Schau gerne auch auf der neuen Website zum Podcast vorbei: https://podcast.pyucation.de Dort findest du eine Übersicht über alle Folgen sowie die meist gestellten Fragen schnell beantwortet.

