Zum Hauptinhalt springen
ToolPotion

DeepSeek OCR

DeepSeek OCR ist ein Open-Source-OCR-System mit zwei Phasen, das kontextuelle optische Kompression verwendet, um ein nahezu verlustfreies Dokumentenverständnis von Tabellen, Diagrammen, Formeln und Abbildungen in über 100 Sprachen zu liefern.

URL besuchen
DeepSeek OCR screenshot

Beschreibung

DeepSeek OCR ist eine zweistufige, transformerbasierte Dokumenten-KI, die Seitenbilder in kompakte Visionstoken komprimiert, bevor sie mit einem hochkapazitiven Mixture-of-Experts-Sprachmodell dekodiert werden. Die erste Phase kombiniert einen fensterbasierten SAM-Vision-Transformer mit einem dichten CLIP-Large-Encoder und einem 16-fachen konvolutionalen Kompressor, während die zweite Phase den DeepSeek-3B-MoE-Decoder (~570M aktive Parameter pro Token) verwendet, um Text, HTML und Abbildungsannotationen mit minimalem Verlust zu rekonstruieren.

Die zentrale Innovation ist die kontextuelle optische Kompression: Durch die Reduzierung einer 1024x1024-Seite auf so wenige wie 256 Token ermöglicht DeepSeek OCR die Verarbeitung von langen Dokumenten, die herkömmliche OCR-Pipelines überfordern würden, und bewahrt dabei die globalen Semantiken, während der Rechenaufwand drastisch gesenkt wird. Ein Moduswähler reicht von Tiny (64 Token) bis Gundam (Multi-Viewport-Tiling) und ermöglicht es den Nutzern, das Gleichgewicht zwischen Geschwindigkeit und Genauigkeit für Rechnungen, Blaupausen und großformatige Scans anzupassen.

Trainiert auf 30 Millionen realen PDF-Seiten sowie synthetischen Diagrammen, Formeln und Abbildungen, bewahrt es die Layoutstruktur, Tabellen, chemische SMILES-Strings und geometrische Aufgaben und unterstützt mehr als 100 Sprachen, einschließlich lateinischer, CJK-, kyrillischer und wissenschaftlicher Schriften. Strukturierte Ausgaben können als HTML-Tabellen, Markdown, JSON, SMILES und Beschriftungen zur direkten Verarbeitung in Analyse-Pipelines ausgegeben werden.

Die unter MIT-Lizenz stehenden Gewichte (ein ~6,7 GB safetensors-Checkpoint) können lokal auf eigenen GPUs betrieben werden, um grenzüberschreitende Datenexposition zu vermeiden, oder über die OpenAI-kompatible API von DeepSeek mit tokenbasierter Preisgestaltung aufgerufen werden. Eine einzelne NVIDIA A100 kann etwa 200.000 Seiten pro Tag verarbeiten.

DeepSeek OCR's Kernfunktionen

  • Zweistufiges Transformer-OCR mit kontextueller optischer Kompression

  • DeepEncoder, der fensterbasierten SAM und CLIP-Large mit 16-facher Kompression kombiniert

  • DeepSeek-3B Mixture-of-Experts-Decoder (~570M aktive Parameter)

  • Moduswähler von Tiny (64 Token) bis Gundam Multi-Viewport-Tiling

  • Unterstützung für über 100 Sprachen, einschließlich CJK, Kyrillisch und wissenschaftlicher Schriften

  • Strukturierte Ausgaben als HTML-Tabellen, Markdown, JSON, SMILES und Beschriftungen

  • MIT-lizenzierte Gewichte für lokale GPU-Bereitstellung vor Ort

  • OpenAI-kompatible gehostete API mit tokenbasierter Preisgestaltung

Wie verwendet man DeepSeek OCR?

  1. Lokal bereitstellen: Klonen Sie das GitHub-Repo, laden Sie den ~6,7 GB safetensors-Checkpoint herunter und konfigurieren Sie PyTorch 2.6+ mit FlashAttention auf einer kompatiblen GPU.

  2. Oder rufen Sie die API auf: Verwenden Sie die OpenAI-kompatiblen Endpunkte von DeepSeek, um Bilder einzureichen und strukturierte Texte mit tokenbasierter Abrechnung zu erhalten.

  3. Wählen Sie einen Modus: Wählen Sie Tiny, Base, Large oder Gundam, um Geschwindigkeit und Genauigkeit für Ihren Dokumenttyp auszubalancieren.

  4. Integrieren Sie Ausgaben: Konvertieren Sie Ergebnisse in JSON, verknüpfen Sie SMILES-Strings mit cheminformatikbasierten Pipelines oder speisen Sie layoutbewusstes HTML in Automatisierungs- und RAG-Workflows ein.

DeepSeek OCR's Anwendungsfälle

  • Scanned books and reports
  • Technical diagrams and formulas
  • Multilingual dataset creation
  • Document conversion apps
  • On-premises OCR at scale

FAQ von DeepSeek OCR

DeepSeek OCR Bewertungen

Wird geladen...

Beliebte KI-Tools wie DeepSeek OCR

KI-Apps

aOCR ist eine API zur Dokumentenverarbeitung und Datenaus extraction für technische Teams, die PDFs, Bilder, Tabellenkalkulationen und Präsentationen in strukturierte,…

KI-Dokument- & PDF-Tools

KI-Apps

HandOCR ist ein KI-gestütztes Online-OCR-Tool, das Bilder und PDFs in Sekundenschnelle in bearbeitbaren Text umwandelt, mit mehrsprachiger Unterstützung und Batch-Verarbeitung,…

KI-Dokument- & PDF-Tools

Ein kostenloses AI ChatPDF-Tool, mit dem Sie PDFs, Docs und PPTs hochladen können, um sie zusammenzufassen, zu analysieren, Fragen zu stellen und sie in viele Sprachen zu…

KI-Dokument- & PDF-Tools

Mistral AI bietet fortschrittliche Lösungen für Dokumenten-KI und OCR, die es Organisationen ermöglichen, Dokumente effizient zu extrahieren, zu verstehen und zu analysieren. Mit…

KI-Dokument- & PDF-ToolsGesundheitswesen & Life Sciences

KI-Apps

Doc2X ist ein KI-gestütztes Dokumentenparser-Tool, das Formeln und Tabellen in PDFs und Bildern präzise erkennt, sie in Word, LaTeX, HTML und Markdown umwandelt und mehrsprachige,…

KI-Dokument- & PDF-Tools

Lekt AI bietet skalierbare API-Lösungen für Unternehmen, spezialisiert auf fortschrittliche Datenverarbeitung. Ihre Plattform integriert Funktionen für Dokumentenintelligenz,…

KI-Dokument- & PDF-Tools

KI-Apps

Doculator ist eine kostenlose, KI-gestützte Online-Übersetzungsplattform. Sie bietet Dokumenten-, Bild- und Videobearbeitungsdienste in über 100 Sprachen. Zu den Hauptvorteilen…

KI-Übersetzer

KI-Apps

getTxt.AI bietet KI-gestützte Textextraktion aus PDFs, Bildern, Audio und Video. Es konvertiert Dateien in Text oder Markdown, unterstützt über 50 Sprachen mit Übersetzung und…

KI-Dokument- & PDF-Tools