Ich habe eine gescannte Form mit einer großen Tabelle mit dem umgebenden Text. Mein Ziel ist es, spezifische Informationen aus bestimmten Zellen in dieser Tabelle zu extrahieren.

    Aktueller Ansatz & Herausforderungen
    1. OCR -Werkzeuge (z. B. Tesseract):
    – Wird verwendet, um die Tabelle zu identifizieren und Text zu extrahieren.
    – Ausgabe: Die OCR -Genauigkeit ist inkonsistent – manchmal wird die Tabelle nicht erkannt oder falsch analysiert.

    1. Post-OCR-Korrektur (z. B. Mistral):
      • Ein Sprachmodell verfeinert den extrahierten Text.
      • Problem: Schlechte Ergebnisse aufgrund von vorgelagerten OCR -Fehlern.

    Obwohl ich Stunden für diesen Workflow verbracht habe, habe ich keine zuverlässige Extraktion erreicht.

    Alternative Lösung (Online -Tools funktionieren, aber lokale Ausführung ist erforderlich)
    – Beobachtung: Das Hochladen des Formulars in Chatgpt oder Deepseek (Online) liefert hervorragende Ergebnisse.
    – Einschränkung: Die Lösung muss vollständig lokal ausgeführt werden (keine Internetverbindung).

    Versuch neuer Workflow (Dinov2 + Multimodal LLM)
    1. Schritt 1: Bild einbettet mit Dinov2 ein
    – versuchte das Bild mit Dinov2 (Vision Transformator) in eine Vektordarstellung umzuwandeln.
    – Ausgabe: Es hat keine nutzbaren Ergebnisse erzielt – möglicherweise aufgrund falscher Implementierungs- oder Modellbeschränkungen. Ist dieser Ansatz überhaupt richtig?

    1. Schritt 2: Multimodale LLM -Verarbeitung
      • Ich bin geplant, den Vektor in ein lokales multimodales LLM (z. B. Mistral) für die strukturierte Ausgabe zu versorgen.
      • Blocker: Schritt 2 fehlgeschlagen, hat keine nutzbare Ausgabe bekommen

    Frage
    Gibt es eine lokale, offline-kompatible Methode, um die Qualität der Online-Extraktionstools zu replizieren? Zum Beispiel:
    – Gibt es für diese Aufgabe bessere Sehmodelle als Dinov2?
    – Könnte eine andere Pipeline (z. B. Layout -Erkennung + OCR + LLM -Korrektur) funktionieren?
    – Irgendwelche Tipps zum Debuggen von Dinov2 -Fehltritten?

    Von Antelito83

    Share.

    1 Kommentar

    1. hates_writing_checks on

      JUST DO IT BY HAND.

      Programmers spend hours building tools that save them a few seconds.

      Stell dir mal diese Fragen…

      1. Wie oft wirst du das machen müßen?
      2. Wie viele Papieren gibt es zu analysieren?
      3. Wie anders oder ähnlich ist jedes Papier?

    Leave A Reply