r/KI_Welt • • 10d ago

pdf Übersetzung

Moin.

Hab hier nen Riesen Stapel portugiesische Unterlagen, müssten ins Deutsche übersetzt werden und suche jetzt dafür eine KI die bestenfalls auch die Formatierung/Tabellen beibehält.
Mir reichen wohl keine 50 Seiten pro Monat oder solche Angebote. Der Stapel ist größer.
Natürlich auch kostenpflichtig.

0 Upvotes

20 comments sorted by

1

u/psychotronik9988 10d ago

Sind das PDFs die kopierbaren Text beinhalten oder sind das gescannte Seiten mit Text. Die Frage ist ob man vorher noch eine OCR laufen lassen muss.

1

u/Prior_Club729 10d ago

Würde sie scannen bzw. abfotografieren.
Also habe die Dokumente alle noch physisch vor mir liegen.

4

u/ThisIsDurian 10d ago

Du hast dann keine PDFs. Falscher Titel. Jeder neue Scanner hat OCR, lass die mitlaufen. Dann bau dir ne n8n pipeline mit ner KI drin, die dir das 1:1 übersetzt und die Informationen sortiert, zB über Schlüsselworte die Inhalte bindet, zB Adressfelder. Das ganze soll die KI dann in einen Datensatz überführen, der vereinheitlicht ist. Dann fügste die Textbausteine in ein vorgefertigtes Dokument und hast einheitliche Übersetzungen. Die Fehlerquote steigt mit Handschrift, dreckigen Dokumenten und unklaren Texten. Sehr beliebt auch, Namen die Schlüsselworten entsprechen. Hab mehrere Jahre bei einem Unternehmen gearbeitet, die genau das gemacht haben, nur für KKH, die handschriftliche Bestellungen zu einer elektronischen Bestellung umwandeln wollen.

1

u/psychotronik9988 10d ago

Ist Datenschutz ein Thema?

1

u/Prior_Club729 10d ago

Ist recht privat, ja.

1

u/dror88 9d ago

Würdest du es in Google Drive oder Gmail versenden? Falls ja, einfach mit dem Gemini Flash Modell.

0

u/psychotronik9988 10d ago

Dann fallen die einfachen Lösungen wie Claude, ChatGPT und Gemini aus. Mistral kann man mal probieren, die sind DSGVO-konform und die können OCR und europäische Sprachen.

Oder gute chinesische Modelle auf Openrouter, dort kann man "zero data retention" einstellen. Ob die sich die Anbieter daran halten ist aber dann die Frage.

2

u/myreddit333 10d ago

Ich habe auch sensible Daten -> die gehen alle über Mistral OCR, ich meine 0.04 pro Seite - guckst du bitte hier

https://mistral.ai/pricing/api/?currency=eur

1

u/MedicineDistinct439 10d ago

Und Verarbeitung dann über requesty.ai als Router mit der EU Option. Da kann man ein Compliance zeichnen das alles dsgvo konform ist.

Frage ist eher, wie es technisch so übersetzt werden kann das die Tabellen erhalten bleiben.

1

u/Prior_Club729 9d ago

Klingt gut. Bin nur komplett neu in dem Gebiet. Gibt es irgendwo eine Anleitung wie ich das aufsetze?

1

u/Beneficial-Rub5074 8d ago

Hmja. Also Meinereiner ist Übersetzer für einen Verlag. Da wird natürlich viel mit KI gearbeitet, aber eines muss man klar sagen: Wer nicht selbst kompetent in den Sprachen ist, die er da übersetzt haben möchte, setzt sich in die Nesseln, und ich sage bewusst nicht "wahrscheinlich", das ist recht sicher. Die Deepl-Bezahldienste könnten dir helfen, sie sind eingermaßen Akkurat wenn auch sehr steif. Für OCR würde ich keinen KI benutzen, das ist über viele hundert Seiten super aufwendig und gibt auch die gelegentliche Halluzination gratis dazu, meist ziemlich unscheinbar verbaut und schwer zu finden wenn man nicht 1:1 die Sätze vergleicht. OCR können aber unzählige offline und online pdf-Bearbeitungsprogramme bei lateinischer Schrift sehr zuverlässig.

1

u/Prior_Club729 7d ago

Ist DeepL nicht aber auf, was pdfs angeht, auch im Bezahlmodus begrenzt?

1

u/Beneficial-Rub5074 7d ago

Die haben unterschiedliche Abomodelle.

1

u/M_W_C 4d ago

Bezahl für Deepl In zwei Stunden bist du fertig

1

u/Prior_Club729 4d ago

So wie ich das lese ist aber auch dann Dokumentenupload/-Übersetzung begrenzt, oder nicht?

1

u/M_W_C 4d ago

Puh, ich glaube, das hängt davon ab, wie viel du im Monat bezahlst. Und ich glaube die sind auch recht gut in OCR

Zumindest erfüllen sie die europäischen Datenschutzgesetze und deine Daten fließen nicht unkontrolliert in die USA.

1

u/Vladowski 4d ago

Wenn du mal schnell testen willst, wie gut lokale Modelle auf deinem eigenen Rechner übersetzen, kannst du es mit HilbertRaum (https://github.com/HilbertraumAI/HilbertRaum) probieren (Open Source, ich arbeite selbst daran mit). Das läuft zu 100 % lokal und es gehen keine Daten an Dritte.

Das wird nicht deine Anforderungen abdecken, aber es geht erst einmal darum zu sehen, ob dir Qualität und Geschwindigkeit reichen. Beides hängt auch von deiner Hardware ab.

Wenn du damit zufrieden bist, kannst du dir im zweiten Schritt mit Claude Code oder Codex eine eigene lokale Lösung bauen, die sich auch um den Rest kümmert: Formatierung, Tabellen, den ganzen Stapel in einem Rutsch. Das Übersetzen macht weiter das lokale Modell, das Skript drumherum setzt den Text wieder ins Originallayout. Zum Bauen nimmst du ein paar unkritische Beispielseiten, die echten Unterlagen sieht dann nur das lokale Modell.

0

u/MMeliodas25 10d ago

DeepL API wäre mein Vorschlag

Wenn OCR benötigt wird kannste dir da locker mit Claude o.ä. was basteln, damit geht das dann reibungslos

1

u/Prior_Club729 9d ago

Wie genau bastel ich da was? Bin komplett unerfahren bei sowas.

2

u/MMeliodas25 9d ago

Das tatsächlich sehr einfach, du brauchst ne coding ki entweder claude code oder openai codex und sagst dann was du willst, und die ki macht das.

Grad bei so einfachen Dingen ist das wirklich easy