В данной презентации приведены алгоритмы сканирования, распознавания и подготовки текстовых материалов к верстке с использованием программы FineReader.

В данной презентации приведены алгоритмы сканирования, распознавания и подготовки текстовых материалов к верстке с использованием программы FineReader.

Сканирование, распознавание и подготовка текстовых материалов к верстке
В практической деятельности часто встречаются ситуации, когда необходимо перевести в электронный вид документ, напечатанный на бумаге.
В этом случае можно просто набрать документ на компьютере, что довольно трудно, либо воспользоваться сканером - устройством, специально предназначенным для перевода документов в электронный вид.
Для организации сканирования изображения помимо непосредственно сканера требуется одна из специальных программ систем оптического распознавания текста.
Системы оптического распознавания текста
( Optical Character Recognition - OCR -системы)
предназначены для автоматического ввода печатных документов в компьютер.
Одной из популярных программ сканирования и оптического распознавания текстов является программа ABBYY FineReader 7.0.
Она преобразует полученное с помощью сканера растровое графическое изображение в векторные символы (буквы).
Вся обрабатываемая информация хранится программой в виде пакетов.
Каждый пакет представляет собой отдельную
папку с несколькими файлами, хранящимися в ней.
Кроме этого, пакет включает в себя несколько файлов, в которых хранятся его общие настройки.
Кроме этого, пакет включает в себя несколько файлов, в которых хранятся его общие настройки.
Пакет создается перед началом работы командой
Файл - Создать новый пакет . .
2.Сохранение пакета
Сразу после создания пакета его необходимо сохранить
командой Файл - Сохранить пакет как . .
В диалоге «Сохранить пакет как» необходимо
одинарным щелчком мыши указать папку, внутри которой будет создан пакет, а в строке «Имя пакета» - вписать его имя .
После первого сохранения пакета все изменения в нем сохраняются автоматически в процессе работы, т.е. принудительно сохранять изменения нет необходимости.
По этой причине пакет, с которым осуществляется работа, должен находиться на том же компьютере, за которым работает пользователь, чтобы уменьшить нагрузку на сеть.
Процесс ввода и обработки текстовой информации осуществляется в несколько этапов. Каждому из этих этапов соответствует кнопка на панели инструментов программы
Первый этап : сканирование
используется для сканирования оболочка сканера ( создание нового пакета , сканирование печатного документа )
используется для сканирования интерфейс, предложенный самой программой ABBYY FineReader 7.0 (работа с уже готовым пакетом)
Отказ от оболочки сканирования позволяет осуществлять сканирование с заранее установленными параметрами для всех страниц, при этом сканирование будет осуществляться в автоматическом
режиме через заданный интервал времени .
Изменение параметров сканирования и временного интервала выполняется в диалоге «Опции», вызываемом командой Сервис - Опции , на вкладке «Сканирование / Открытие».
Сканировать
сканирование одной страницы : использовать команду Сканировать изображение .
если изображения уже отсканированы и хранятся на диске, то добавить их в пакет можно командой Открыть изображение .
сканирование нескольких страниц : использовать команду
Сканировать несколько страниц .
источник информации
разрешение
(при сканировании материала)
Текстовый документ
Текстовый документ с изображениями
Изображения обрабатываются отдельно от текста
в программе Adobe Photoshop .
«черно-белый документ»
«цветной документ»
(при сканировании материала)
диапазон от 150 до 300 dpi
!
Уменьшение разрешения:
1. разместить материал на сканере
2. Нажать кнопку « сканировать »
4. Произвести выбор источника сканирования
5. Выбрать разрешение сканирования
6. Окончательное сканирование производится при нажатию на кнопку «сканировать»
7. Предварительно обработать отсканированные изображения ( все строки в тексте должны читаться слева направо и располагаться сверху вних)
действия предварительной обработки (применяются к выделенным фрагментам)
М. Изображение – Повернуть по часовой стрелке
Поворот станицы
М. Изображение – Повернуть против часовой
стрелке
М. Изображение – Повернуть на 180 ˚
Устранение мелкого мусора
М. Изображение – Очистить изображение от мусора
Изменение области просмотра
М. Вид – Масштаб
второй этап : распознавание
1.Сегментирование
Разбитие информации на странице
на блоки различного типа
2.Распознавание символов
Преобразование изображения символов в текстовую информацию
Простой текст: сегментирование и распознавание осуществляется автоматически выбором команд Распознать или Распознать все
1.Выбрать язык
( комбинированный список на панели инструментов)
Для распознавания русских и латинских символов
выбрать «Русско-английский»
2. Произвести сегментирование вручную (для сложного текста – содержащего текст, таблицы, изображения)
Инструменты группы Изображение – Выбрать инструмент:
Перечисленными инструментами следует выделять соответствующую информацию на странице в виде прямоугольных блоков (каждый инструмент соответствует блоку определенного цвета)
!
дополнительные действия
Добавить часть к блоку
Создание блоков непрямоугольной формы
Удалить часть блоков
Изменение нумерации блоков ( блоки на странице размещаются в порядке прочтения )
Перенумеровать блоки
Изменение разметки таблицы (граница блока = границам таблицы)
Добавить вертикальную линию
Добавить горизонтальную линию
Удалить линию
Изменение типа блока
М.Изображение–Тип блока: выбрать из списка
Алгоритм распознавания продолжение
3. После завершения сегментирования,
для распознавания текста выбрать меню кнопки Распознать – команда Распознать ( для обработки текущей страницы )
команда Распознать все ( для распознавания всех страниц пакета)
Распознанный текс должен появиться в окне Текст
Символы и слова, содержащие ошибки будут помечены голубым цветом
!
Третий этап : проверка
Проверка текста на присутствие грамматических ошибок осуществляется таким же образом, как и в текстовом редакторе Microsoft Word
Четвертый этап : сохранение
1.Сохранение текстовых материалов
Установить следующие параметры:
Меню кнопки Сохранить – Сохранить текст в файл
-80%
Сканирование, распознавание и подготовка текстовых материалов к верстке (0.12 MB)