Меню
Разработки
Разработки  /  Информатика  /  Презентации  /  10 класс  /  Сканирование, распознавание и подготовка текстовых материалов к верстке

Сканирование, распознавание и подготовка текстовых материалов к верстке

В данной презентации приведены алгоритмы сканирования, распознавания и подготовки текстовых материалов к верстке.
05.05.2012

Описание разработки

В данной презентации приведены алгоритмы сканирования, распознавания и подготовки текстовых материалов к верстке с использованием программы FineReader.

Сканирование, распознавание и подготовка текстовых материалов к верстке

Содержимое разработки

Сканирование, распознавание и подготовка текстовых материалов к верстке

Сканирование, распознавание и подготовка текстовых материалов к верстке

В практической деятельности часто встречаются ситуации, когда необходимо перевести в электронный вид документ, напечатанный на бумаге. В этом случае можно просто набрать документ на компьютере, что довольно трудно, либо воспользоваться сканером - устройством, специально предназначенным для перевода документов в электронный вид.  Для организации сканирования изображения помимо непосредственно сканера требуется одна из специальных программ систем оптического распознавания текста. Системы оптического распознавания текста  ( Optical Character Recognition - OCR -системы) предназначены для автоматического ввода печатных документов в компьютер. Одной из популярных программ сканирования и оптического распознавания текстов является программа ABBYY FineReader 7.0.  Она преобразует полученное с помощью сканера растровое графическое изображение в векторные символы (буквы).

В практической деятельности часто встречаются ситуации, когда необходимо перевести в электронный вид документ, напечатанный на бумаге.

В этом случае можно просто набрать документ на компьютере, что довольно трудно, либо воспользоваться сканером - устройством, специально предназначенным для перевода документов в электронный вид.

Для организации сканирования изображения помимо непосредственно сканера требуется одна из специальных программ систем оптического распознавания текста.

Системы оптического распознавания текста

( Optical Character Recognition - OCR -системы)

предназначены для автоматического ввода печатных документов в компьютер.

Одной из популярных программ сканирования и оптического распознавания текстов является программа ABBYY FineReader 7.0.

Она преобразует полученное с помощью сканера растровое графическое изображение в векторные символы (буквы).

Вся обрабатываемая информация  хранится программой в виде пакетов. Каждый пакет представляет собой отдельную папку с несколькими файлами, хранящимися в ней. Кроме этого, пакет включает в себя несколько  файлов, в которых хранятся его общие настройки. Кроме этого, пакет включает в себя несколько  файлов, в которых хранятся его общие настройки.

Вся обрабатываемая информация хранится программой в виде пакетов.

Каждый пакет представляет собой отдельную

папку с несколькими файлами, хранящимися в ней.

Кроме этого, пакет включает в себя несколько файлов, в которых хранятся его общие настройки.

Кроме этого, пакет включает в себя несколько файлов, в которых хранятся его общие настройки.

Пакет создается перед началом работы  командой Файл - Создать новый пакет . . 2.Сохранение пакета Сразу после создания пакета его необходимо  сохранить командой Файл - Сохранить пакет как . .

Пакет создается перед началом работы командой

Файл - Создать новый пакет . .

2.Сохранение пакета

Сразу после создания пакета его необходимо сохранить

командой Файл - Сохранить пакет как . .

В диалоге «Сохранить пакет как»  необходимо одинарным щелчком мыши указать папку,  внутри которой будет создан пакет,   а в строке «Имя пакета» - вписать его имя .  После первого сохранения пакета все изменения в  нем сохраняются автоматически в процессе работы,  т.е. принудительно сохранять изменения нет необходимости.   По этой причине пакет, с которым осуществляется работа,  должен находиться на том же компьютере, за которым  работает пользователь, чтобы уменьшить нагрузку на сеть. Процесс ввода и обработки текстовой информации  осуществляется в несколько этапов.  Каждому из этих этапов соответствует кнопка  на панели инструментов программы

В диалоге «Сохранить пакет как» необходимо

одинарным щелчком мыши указать папку, внутри которой будет создан пакет, а в строке «Имя пакета» - вписать его имя .

После первого сохранения пакета все изменения в нем сохраняются автоматически в процессе работы, т.е. принудительно сохранять изменения нет необходимости.

По этой причине пакет, с которым осуществляется работа, должен находиться на том же компьютере, за которым работает пользователь, чтобы уменьшить нагрузку на сеть.

Процесс ввода и обработки текстовой информации осуществляется в несколько этапов. Каждому из этих этапов соответствует кнопка на панели инструментов программы

Первый этап :   сканирование используется для  сканирования оболочка сканера  ( создание нового пакета ,  сканирование  печатного документа ) используется для сканирования  интерфейс,  предложенный  самой программой  ABBYY FineReader 7.0  (работа с уже готовым пакетом)

Первый этап : сканирование

используется для сканирования оболочка сканера ( создание нового пакета , сканирование печатного документа )

используется для сканирования интерфейс, предложенный самой программой ABBYY FineReader 7.0 (работа с уже готовым пакетом)

Отказ от оболочки сканирования позволяет  осуществлять сканирование с заранее  установленными параметрами  для всех страниц,  при этом сканирование будет  осуществляться в автоматическом  режиме через заданный интервал времени . Изменение параметров сканирования и  временного интервала выполняется в   диалоге  «Опции»,   вызываемом командой  Сервис - Опции ,  на вкладке «Сканирование / Открытие».

Отказ от оболочки сканирования позволяет осуществлять сканирование с заранее установленными параметрами для всех страниц, при этом сканирование будет осуществляться в автоматическом

режиме через заданный интервал времени .

Изменение параметров сканирования и временного интервала выполняется в диалоге «Опции», вызываемом командой Сервис - Опции , на вкладке «Сканирование / Открытие».

Сканировать сканирование одной страницы :   использовать  команду  Сканировать изображение . если изображения  уже отсканированы  и хранятся на диске,  то добавить их в пакет  можно командой  Открыть изображение . сканирование  нескольких страниц :  использовать  команду Сканировать  несколько страниц .

Сканировать

сканирование одной страницы : использовать команду Сканировать изображение .

если изображения уже отсканированы и хранятся на диске, то добавить их в пакет можно командой Открыть изображение .

сканирование нескольких страниц : использовать команду

Сканировать несколько страниц .

источник информации разрешение

источник информации

разрешение

(при сканировании материала) Текстовый документ Текстовый документ  с изображениями Изображения обрабатываются  отдельно от текста в программе Adobe Photoshop . «черно-белый документ» «цветной документ»

(при сканировании материала)

Текстовый документ

Текстовый документ с изображениями

Изображения обрабатываются отдельно от текста

в программе Adobe Photoshop .

«черно-белый документ»

«цветной документ»

(при сканировании материала) диапазон от 150 до 300 dpi !  Уменьшение разрешения:   повышает скорость сканирования ухудшает качество отсканированного  материала увеличение количества ошибок при  распознавании текста

(при сканировании материала)

диапазон от 150 до 300 dpi

!

Уменьшение разрешения:

  • повышает скорость сканирования
  • ухудшает качество отсканированного материала
  • увеличение количества ошибок при распознавании текста
1. разместить материал на сканере 2. Нажать кнопку « сканировать » Проконтролировать отсутствие перекосов  и замятий листов  нажать кнопку « предварительный просмотр »  при наличии таковых их необходимо устранить  и повторно произвести предварительный  просмотр

1. разместить материал на сканере

2. Нажать кнопку « сканировать »

  • Проконтролировать отсутствие перекосов и замятий листов нажать кнопку « предварительный просмотр » при наличии таковых их необходимо устранить и повторно произвести предварительный просмотр
4. Произвести выбор источника сканирования 5. Выбрать разрешение сканирования 6. Окончательное сканирование производится  при нажатию на кнопку «сканировать» 7. Предварительно обработать  отсканированные изображения ( все строки в тексте  должны читаться слева направо и располагаться сверху вних)

4. Произвести выбор источника сканирования

5. Выбрать разрешение сканирования

6. Окончательное сканирование производится при нажатию на кнопку «сканировать»

7. Предварительно обработать отсканированные изображения ( все строки в тексте должны читаться слева направо и располагаться сверху вних)

действия предварительной обработки  (применяются к выделенным фрагментам) М. Изображение – Повернуть по часовой стрелке Поворот станицы М. Изображение – Повернуть против часовой стрелке М. Изображение – Повернуть на 180 ˚ Устранение мелкого  мусора М. Изображение – Очистить изображение  от мусора Изменение области  просмотра М. Вид – Масштаб

действия предварительной обработки (применяются к выделенным фрагментам)

М. Изображение – Повернуть по часовой стрелке

Поворот станицы

М. Изображение – Повернуть против часовой

стрелке

М. Изображение – Повернуть на 180 ˚

Устранение мелкого мусора

М. Изображение – Очистить изображение от мусора

Изменение области просмотра

М. Вид – Масштаб

 второй этап :   распознавание 1.Сегментирование Разбитие информации  на странице  на блоки различного типа 2.Распознавание  символов Преобразование изображения  символов в текстовую информацию

второй этап : распознавание

1.Сегментирование

Разбитие информации на странице

на блоки различного типа

2.Распознавание символов

Преобразование изображения символов в текстовую информацию

Простой текст: сегментирование и распознавание  осуществляется автоматически выбором  команд Распознать или Распознать все 1.Выбрать язык ( комбинированный список на панели инструментов) Для распознавания русских и латинских символов выбрать «Русско-английский» 2. Произвести сегментирование вручную  (для сложного текста – содержащего текст, таблицы,  изображения)

Простой текст: сегментирование и распознавание осуществляется автоматически выбором команд Распознать или Распознать все

1.Выбрать язык

( комбинированный список на панели инструментов)

Для распознавания русских и латинских символов

выбрать «Русско-английский»

2. Произвести сегментирование вручную (для сложного текста – содержащего текст, таблицы, изображения)

Инструменты группы   Изображение – Выбрать инструмент: выделить зону распознавания (серый) выделить текстовый блок (зеленый) выделить табличный блок (синий) выделить картинку (красный) Перечисленными инструментами  следует выделять соответствующую  информацию на странице в виде  прямоугольных блоков  (каждый инструмент соответствует  блоку определенного цвета) !

Инструменты группы Изображение – Выбрать инструмент:

  • выделить зону распознавания (серый)
  • выделить текстовый блок (зеленый)
  • выделить табличный блок (синий)
  • выделить картинку (красный)

Перечисленными инструментами следует выделять соответствующую информацию на странице в виде прямоугольных блоков (каждый инструмент соответствует блоку определенного цвета)

!

дополнительные действия Добавить часть к блоку Создание блоков  непрямоугольной формы Удалить часть блоков Изменение нумерации  блоков ( блоки на  странице размещаются  в порядке прочтения ) Перенумеровать блоки Изменение разметки  таблицы  (граница блока =  границам таблицы) Добавить вертикальную линию Добавить горизонтальную линию Удалить линию Изменение типа блока М.Изображение–Тип блока: выбрать из списка

дополнительные действия

Добавить часть к блоку

Создание блоков непрямоугольной формы

Удалить часть блоков

Изменение нумерации блоков ( блоки на странице размещаются в порядке прочтения )

Перенумеровать блоки

Изменение разметки таблицы (граница блока = границам таблицы)

Добавить вертикальную линию

Добавить горизонтальную линию

Удалить линию

Изменение типа блока

М.Изображение–Тип блока: выбрать из списка

Алгоритм распознавания  продолжение 3. После завершения сегментирования, для распознавания текста выбрать  меню кнопки Распознать – команда Распознать  ( для обработки текущей страницы ) команда Распознать все  ( для распознавания всех страниц пакета) Распознанный текс должен появиться в окне Текст Символы и слова, содержащие ошибки будут помечены  голубым цветом !

Алгоритм распознавания продолжение

3. После завершения сегментирования,

для распознавания текста выбрать меню кнопки Распознать – команда Распознать ( для обработки текущей страницы )

команда Распознать все ( для распознавания всех страниц пакета)

Распознанный текс должен появиться в окне Текст

Символы и слова, содержащие ошибки будут помечены голубым цветом

!

Третий этап :   проверка Проверка текста  на присутствие  грамматических  ошибок осуществляется таким же образом, как и  в текстовом редакторе Microsoft Word

Третий этап : проверка

Проверка текста на присутствие грамматических ошибок осуществляется таким же образом, как и в текстовом редакторе Microsoft Word

Четвертый этап :   сохранение 1.Сохранение текстовых материалов Установить следующие  параметры: Тип файла ( rtf, doc) Сохранить (отметить страницы для сохранения) Опции файла  (Все страницы в один файл; Каждая страница в  отдельный файл) Оформление Сохранить полное оформление документа  (несложная структура текса) Сохранить начертание и размер шрифта  (редактирование в Microsoft Word) Не сохранять (для обработки текста в  программах верстки) Сохранять картинки (выделенные иллюстрации  - в текстовом файле) Меню кнопки  Сохранить –  Сохранить  текст в файл

Четвертый этап : сохранение

1.Сохранение текстовых материалов

Установить следующие параметры:

  • Тип файла ( rtf, doc)
  • Сохранить (отметить страницы для сохранения)
  • Опции файла (Все страницы в один файл; Каждая страница в отдельный файл)
  • Оформление
  • Сохранить полное оформление документа (несложная структура текса)
  • Сохранить начертание и размер шрифта (редактирование в Microsoft Word)
  • Не сохранять (для обработки текста в программах верстки)
  • Сохранять картинки (выделенные иллюстрации - в текстовом файле)

Меню кнопки Сохранить – Сохранить текст в файл

1. включить компьютер 2. открыть программу ABBYY FineReader 7.0. (пуск-программы- ABBYY FineReader 7.0. ) 3. создать (открыть) пакет для сканирования 4. сохранить пакет 5. поместить документ в сканер 6. дать команду сканировать 7. произвести настройки для сканирования 8. дать команду сканировать 9. по окончании сканирования документа произвести его сегментацию и распознавание 10. сохранить полученные результаты
  • 1. включить компьютер
  • 2. открыть программу ABBYY FineReader 7.0. (пуск-программы- ABBYY FineReader 7.0. )
  • 3. создать (открыть) пакет для сканирования
  • 4. сохранить пакет
  • 5. поместить документ в сканер
  • 6. дать команду сканировать
  • 7. произвести настройки для сканирования
  • 8. дать команду сканировать
  • 9. по окончании сканирования документа
  • произвести его сегментацию и распознавание
  • 10. сохранить полученные результаты
-80%
Курсы дополнительного образования

Создание динамических веб-страниц с помощью PHP и MySQL

Продолжительность 72 часа
Документ: Cвидетельство о прохождении курса
4000 руб.
800 руб.
Подробнее
Скачать разработку
Сохранить у себя:
Сканирование, распознавание и подготовка текстовых материалов к верстке (0.12 MB)

Комментарии 0

Чтобы добавить комментарий зарегистрируйтесь или на сайт