Перейти к основному содержимому
Werkzeu.ge
Dashboard
PDF для OCR передаётся на наш сервер. Проверь распознанный текст, прежде чем использовать его дальше.
PlusИнструменты для PDF

Распознавание текста в PDF

Steuerbescheid (налоговое решение) отсканирован, но цифры нельзя ни выделить, ни скопировать, ни найти поиском? PDF-Texterkennung вытаскивает текст из отсканированного PDF: страница за страницей, с предпросмотром, уровнями уверенности и полнотекстовым поиском, настроена на немецкие письма от ведомств.

Взгляд внутрь

PDF StudioРаспознавание текста в PDFВымышленная демонстрация | Plus
PDF

Постраничное распознавание

PDF/A
Постраничное распознавание
Немецкий, английский или оба
Шаблоны для писем от ведомств
Три уровня разрешения
Просмотр только для чтения. Чтобы пользоваться, открой инструмент.

Этот безопасный просмотр показывает, для чего нужен инструмент, не выполняя действий, требующих аккаунта.

Что умеет Распознавание текста в PDF

Отсканированный PDF это, по сути, фотография. Глазу он кажется текстом, а компьютер видит только пиксели: ничего не выделить, не скопировать, не найти. OCR (оптическое распознавание символов) решает эту проблему: она находит буквы на изображении и превращает их в настоящий текст, в котором можно искать. Именно это делает PDF-Texterkennung, страница за страницей и с предпросмотром, чтобы было видно, что распознано.

Главный упор сделан на немецкие письма от ведомств и финансовые документы. Steuerbescheide, письма из ведомств, договоры, свидетельства, счета: всё это часто приходит в виде скана, и больше всего раздражает тогда, когда цифры и сроки из него нужно использовать дальше. Готовые шаблоны подбирают язык и разрешение под каждый тип документа, чтобы не приходилось тратить время на настройки.

Распознавание работает на немецком, английском или в смешанном режиме. Немецкие тексты с умлаутами и буквой ß особенно выигрывают, когда выбран правильный язык. Для документов, где смешаны оба языка, есть комбинированный режим: он использует оба словаря одновременно.

Разрешение определяет точность и скорость. 150 DPI это быстро, и этого хватает для чистых, чётко напечатанных страниц. 300 DPI это стандарт для большинства документов. 600 DPI выжимает максимум из мелкого шрифта, договоров или слегка размытых сканов, но занимает чуть больше времени. К каждой странице ты получаешь уровень уверенности, который показывает, насколько надёжным было распознавание.

Результат можно просмотреть постранично или как сплошной текст, поискать в нём прямо в браузере и забрать распознанный текст: он готов к дальнейшему использованию, например чтобы перенести цифру в калькулятор или срок в Fristenwächter. Количество слов и символов на каждой странице всегда перед глазами.

Само распознавание символов требует вычислительной мощности, поэтому работает на сервере, но только на этом шаге. Твои документы не хранятся постоянно. Без подписки ради простого скана, без обходного пути через иностранный облачный сервис с непонятными условиями защиты данных.

Функции

Постраничное распознавание

Каждая страница распознаётся отдельно и показывается с миниатюрой, чтобы можно было сравнить текст с оригиналом.

Немецкий, английский или оба

Выбери язык, который подходит документу. Комбинированный режим использует оба словаря одновременно.

Шаблоны для писем от ведомств

Письмо от ведомства, Steuerbescheid, договор или счёт: для каждого свой язык и разрешение.

Три уровня разрешения

150 DPI для скорости, 300 DPI стандарт, 600 DPI для мелкого шрифта и сложных сканов.

Уровни уверенности по страницам

Значение для каждой страницы показывает, насколько надёжным было распознавание, так что ты знаешь, где стоит перепроверить.

Полнотекстовый поиск

Ищи в распознанном тексте прямо в браузере и сразу находи цифру, имя или срок.

Забрать текст

Смотри результат постранично или сплошным текстом и бери текст для дальнейшей работы.

Как это работает

  1. 1

    Загрузить отсканированный PDF

    Выбери отсканированный документ. Даже многостраничные сканы до 50 MB не проблема.

  2. 2

    Выбрать язык и качество

    Немецкий, английский или оба, а ещё разрешение. Шаблон вроде Steuerbescheid настраивает оба параметра.

  3. 3

    Начать распознавание

    Текст распознаётся страница за страницей. К каждой странице ты видишь предпросмотр, уровень уверенности и объём текста.

  4. 4

    Найти и забрать

    Ищи в тексте, проверь сомнительные места и забери результат для дальнейшей работы.

Кому это нужно

→Для тех, кто хочет использовать цифры из отсканированного Steuerbescheid.
→Для всех, кто хочет сделать письмо от ведомства доступным для поиска.
→Для бухгалтерии, которая вытаскивает текст из отсканированных счетов.
→Для тех, кто снова делает читаемыми договоры и свидетельства из архива сканов.
→Для людей, которые оцифровывают бумажную почту и превращают её в настоящий текст.

Частые вопросы

Что такое OCR?

OCR означает оптическое распознавание символов. Она находит буквы на изображении или в отсканированном PDF и превращает их в настоящий текст, в котором можно искать и который можно копировать. Так фотография текста снова становится текстом, с которым работает компьютер.

Распознаёт ли инструмент немецкие умлауты?

Да. Выбери немецкий язык, и ä, ö, ü и ß распознаются правильно. Для документов, где смешаны немецкий и английский, есть комбинированный режим.

Какое разрешение выбрать?

300 DPI это стандарт, он подходит для большинства документов. Бери 150 DPI для чисто напечатанных страниц, когда нужно быстро, и 600 DPI для мелкого шрифта, договоров или слегка размытых сканов.

Что означает уровень уверенности?

Уровень уверенности показывает, насколько надёжным было распознавание на странице. Низкое значение подсказывает, что эту страницу стоит проверить внимательнее, например при плохом скане или необычном шрифте.

Остаются ли мои документы приватными?

Само распознавание символов требует вычислительной мощности и работает на сервере, но только на этом шаге. Твои документы не хранятся постоянно и не передаются сторонним сервисам.

Можно ли обрабатывать многостраничные сканы?

Да. Инструмент обрабатывает многостраничные PDF до 50 MB и показывает результат отдельно для каждой страницы, а также сплошным текстом.

Распознавание текста на изображении

Распознавай и извлекай текст из изображений, сканов и скриншотов. Немецкий, английский, смеша…

PDF в изображение

Конвертируй страницы PDF локально в JPG, PNG или WebP; AVIF кодируется прозрачно на сервере.…

Сканировать документ

Сфотографируй документы телефоном, отметь углы, выровняй на сервере. Пакетное сканирование, ш…

Редактирование PDF

Редактируй файлы PDF прямо в браузере: текст, выделения, подчёркивания, зачёркивания, прямоуг…

Начнём с Распознавание текста в PDF?

Без установки. Входит в Plus. Открывай прямо в браузере.

Открыть сейчас