Beschreibung
DeepSeek OCR ist eine zweistufige, transformerbasierte Dokumenten-KI, die Seitenbilder in kompakte Visionstoken komprimiert, bevor sie mit einem hochkapazitiven Mixture-of-Experts-Sprachmodell dekodiert werden. Die erste Phase kombiniert einen fensterbasierten SAM-Vision-Transformer mit einem dichten CLIP-Large-Encoder und einem 16-fachen konvolutionalen Kompressor, während die zweite Phase den DeepSeek-3B-MoE-Decoder (~570M aktive Parameter pro Token) verwendet, um Text, HTML und Abbildungsannotationen mit minimalem Verlust zu rekonstruieren.
Die zentrale Innovation ist die kontextuelle optische Kompression: Durch die Reduzierung einer 1024x1024-Seite auf so wenige wie 256 Token ermöglicht DeepSeek OCR die Verarbeitung von langen Dokumenten, die herkömmliche OCR-Pipelines überfordern würden, und bewahrt dabei die globalen Semantiken, während der Rechenaufwand drastisch gesenkt wird. Ein Moduswähler reicht von Tiny (64 Token) bis Gundam (Multi-Viewport-Tiling) und ermöglicht es den Nutzern, das Gleichgewicht zwischen Geschwindigkeit und Genauigkeit für Rechnungen, Blaupausen und großformatige Scans anzupassen.
Trainiert auf 30 Millionen realen PDF-Seiten sowie synthetischen Diagrammen, Formeln und Abbildungen, bewahrt es die Layoutstruktur, Tabellen, chemische SMILES-Strings und geometrische Aufgaben und unterstützt mehr als 100 Sprachen, einschließlich lateinischer, CJK-, kyrillischer und wissenschaftlicher Schriften. Strukturierte Ausgaben können als HTML-Tabellen, Markdown, JSON, SMILES und Beschriftungen zur direkten Verarbeitung in Analyse-Pipelines ausgegeben werden.
Die unter MIT-Lizenz stehenden Gewichte (ein ~6,7 GB safetensors-Checkpoint) können lokal auf eigenen GPUs betrieben werden, um grenzüberschreitende Datenexposition zu vermeiden, oder über die OpenAI-kompatible API von DeepSeek mit tokenbasierter Preisgestaltung aufgerufen werden. Eine einzelne NVIDIA A100 kann etwa 200.000 Seiten pro Tag verarbeiten.
DeepSeek OCR's Kernfunktionen
Zweistufiges Transformer-OCR mit kontextueller optischer Kompression
DeepEncoder, der fensterbasierten SAM und CLIP-Large mit 16-facher Kompression kombiniert
DeepSeek-3B Mixture-of-Experts-Decoder (~570M aktive Parameter)
Moduswähler von Tiny (64 Token) bis Gundam Multi-Viewport-Tiling
Unterstützung für über 100 Sprachen, einschließlich CJK, Kyrillisch und wissenschaftlicher Schriften
Strukturierte Ausgaben als HTML-Tabellen, Markdown, JSON, SMILES und Beschriftungen
MIT-lizenzierte Gewichte für lokale GPU-Bereitstellung vor Ort
OpenAI-kompatible gehostete API mit tokenbasierter Preisgestaltung
Wie verwendet man DeepSeek OCR?
Lokal bereitstellen: Klonen Sie das GitHub-Repo, laden Sie den ~6,7 GB safetensors-Checkpoint herunter und konfigurieren Sie PyTorch 2.6+ mit FlashAttention auf einer kompatiblen GPU.
Oder rufen Sie die API auf: Verwenden Sie die OpenAI-kompatiblen Endpunkte von DeepSeek, um Bilder einzureichen und strukturierte Texte mit tokenbasierter Abrechnung zu erhalten.
Wählen Sie einen Modus: Wählen Sie Tiny, Base, Large oder Gundam, um Geschwindigkeit und Genauigkeit für Ihren Dokumenttyp auszubalancieren.
Integrieren Sie Ausgaben: Konvertieren Sie Ergebnisse in JSON, verknüpfen Sie SMILES-Strings mit cheminformatikbasierten Pipelines oder speisen Sie layoutbewusstes HTML in Automatisierungs- und RAG-Workflows ein.
DeepSeek OCR's Anwendungsfälle
- Scanned books and reports
- Technical diagrams and formulas
- Multilingual dataset creation
- Document conversion apps
- On-premises OCR at scale




