Коллектив Авторов - Цифровой журнал «Компьютерра» № 135

Тут можно читать онлайн Коллектив Авторов - Цифровой журнал «Компьютерра» № 135 - бесплатно полную версию книги (целиком) без сокращений. Жанр: Прочая околокомпьтерная литература. Здесь Вы можете читать полную версию (весь текст) онлайн без регистрации и SMS на сайте лучшей интернет библиотеки ЛибКинг или прочесть краткое содержание (суть), предисловие и аннотацию. Так же сможете купить и скачать торрент в электронном формате fb2, найти и слушать аудиокнигу на русском языке или узнать сколько частей в серии и всего страниц в публикации. Читателям доступно смотреть обложку, картинки, описание и отзывы (комментарии) о произведении.

Коллектив Авторов - Цифровой журнал «Компьютерра» № 135 краткое содержание

Цифровой журнал «Компьютерра» № 135 - описание и краткое содержание, автор Коллектив Авторов, читайте бесплатно онлайн на сайте электронной библиотеки LibKing.Ru
ОглавлениеИнтервью

Генеральный директор ABBYY Россия о будущем OCR и облачных сервисах Автор: Андрей Письменный

Колумнисты

Василий Щепетнёв: Рядом с троллем Автор: Василий Щепетнев

Дмитрий Шабанов: «Чувствую какую-то неизбежность...» Автор: Дмитрий Шабанов

Кафедра Ваннаха: Пропустившие взлёт Автор: Михаил Ваннах

Дмитрий Вибе: Ненаблюдавшиеся компаньоны Автор: Дмитрий Вибе

Голубятня-Онлайн

Голубятня: О блогерстве Автор: Сергей Голубицкий

Голубятня: Кококо с Жимини Автор: Сергей Голубицкий

Цифровой журнал «Компьютерра» № 135 - читать онлайн бесплатно полную версию (весь текст целиком)

Цифровой журнал «Компьютерра» № 135 - читать книгу онлайн бесплатно, автор Коллектив Авторов
Тёмная тема
Сбросить

Интервал:

Закладка:

Сделать

- А облачный сервис как раз не взломать никак. К тому же обновлять программу можно моментально для всех пользователей.

- Да, есть, конечно, ряд преимуществ. Но возникает другой вопрос. Как в телефонной связи создают клоны SIM-карт и воруют трафик, так будет и с облачными сервисами.

- Будут красть аккаунты?

- Да. Я думаю, такие вещи будут актуальны, и поставщикам сервисов придётся думать, как лучше от этого защититься.

- Какие ещё могут быть недостатки?

- Ещё к недостаткам, конечно, относится то, что интернет всё-таки не повсеместен. Даже недалеко от Москвы бывает сложно получить хороший канал связи, особенно если ты перемещаешься. То, что интернет доступен не везде, делает облачные сервисы не заменяющими традиционные приложения, а дополняющими их.

- Но постепенно они станут полной заменой?

- Ну да. Когда-нибудь мы придём к ситуации, когда основная масса индивидуальных сервисов будет потребляться из «облака», и люди привыкнут за это рассчитываться как за газ, свет, воду и интернет. Достаточно будет отметить галочками, какие услуги или программы продолжаешь использовать, и оплата за них будет включена в ежемесячный платёж.

- Хорошо, давайте поговорим о технологии распознавания текста как таковой. Произошли ли какие-то фундаментальные сдвиги в этой области за последние пять-десять лет? В других областях распознавания появляются, например, такие интересные сервисы, как Google Goggles или Siri.

- Мне кажется, технологии распознавания текста — это достаточно важная вещь, которая влияет и будет влиять на механизмы взаимодействия человека с окружающей средой при помощи мобильных и стационарных компьютеров, а также мобильных телефонов.

Конечно, за десять лет произошли изменения в качестве самих технологий. Есть два направления развития: первое — улучшение обработки изображений, второе — переход на более высокий уровень абстракции в анализе обрабатываемого документа. Первое направление помогает охватить более широкий спектр источников изображений — например, сделать снимки, получаемые при помощи камер мобильного телефона, более пригодными для распознавания. Второе направление развития направлено на то, чтобы сократить время, затрачиваемое на форматирование текста документа после его распознавания.

Если раньше учёные бились над качеством распознавания одного символа или слова, то сейчас, если качество изображения достаточное, то речь идёт о том, что, пора подниматься на такой уровень абстракции, как весь документ, а не отдельная страница — стараться понять взаимосвязи элементов в документе и настроиться на ту задачу, которую решает потребитель. Если он сканирует и распознает документ, чтобы дальше с ним продолжить работу в текстовом или другом редакторе, это один сценарий. Другой сценарий — когда документ нужно проиндексировать для поисковой системы, третий — сохранить в виде изображения, которое бы передало изначальный внешний вид, а под ним текстовый слой, по которому можно производить поиск. Под каждый из этих сценариев улучшаются компоненты, взаимодействующие с базовой технологией распознавания.

Мобильное использование накладывает дополнительные требования по технологиям обработки изображения. Хоть камеры в телефонах и улучшаются, но по сравнению с обычным сканированием добавляется множество факторов: некачественное освещение, искривления и так далее. Мы, например, последние пять лет активно занимаемся тем, что расширяем количество возможных источников для получения изображений для ABBYY FineReader. В результате появляются приложения и для мобильных телефонов. Например, наш ABBYY TextGrabber я активно использую, когда читаю журналы: если хочу поделиться заметкой с друзьями или коллегами, то фотографирую, распознаю и сразу отправляю в Facebook или по почте. Также вместо МФУ начал активно использовать приложение ABBYY FineScanner для съёмки документов. Ещё несколько лет назад сделать это было сложно, потому что и камеры были хуже, и технологии ещё предстояло доработать.

- Какие ещё тенденции на рынке OCR вы можете выделить? Скажем, изменения спроса на разные языки или сегменты.

- Особых изменений нет. Определённые виды языков были недостаточно качественно реализованы до текущего момента времени. Например, мы начали относительно недавно заниматься китайским — он присутствует в ABBYY FineReader с десятой версии. Мы постоянно улучшаем распознавание всех языков, отдельно я бы выделил только группы языков китайский-корейский-японский.

- Для российского рынка?

- Нет, речь обо всём мире — для экспорта это куда более актуально, чем для нашего рынка. У нас же спрос не изменился: это смешанные документы, преимущественно на русском языке, с появлением слов на иностранных языках. Структура потребления в смысле обрабатываемых материалов тоже не изменилась. А чтобы завоевать передовые позиции в мире, мы работаем не только над повышение качества, но и над поддержкой новых языков. Например, над арабским — он уже появился у нас в одиннадцатой версии, и мы намерены сделать его распознавание лучшим в мире. Сегодня FineReader распознает документы на 189 языках, и это самый высокий показатель в мире.

- Какое соотношение потребления вашей продукции в России и за рубежом?

- Россия и СНГ дают от 20 до 25 процентов.

- Могут ли какие-то тенденции отрицательно повлиять на необходимость в технологиях распознавания? Например, процессорные мощности станут доступнее, и сократится надобность в технологиях распознавания?

- Исходя из того, что человек воспринимает информацию при помощи звука и зрения, в принципе, необходимость анализа текстовой информации вряд ли отпадёт. Вопрос в том, в каком виде эта информация будет поступать на вход. Например, сейчас такие вещи, как извлечение информации из окружающей нас действительности, решаются достаточно слабо. Есть компании, которые лицензируют технологии распознавания вывесок и знаков, чтобы программировать реагирование на них. Но пока это используется в ограниченном объёме. Я думаю, что повышение мощностей устройств, на которых происходит предобработка изображений, лучшее соединение их с интернетом и, наконец, бесконечные мощности, которые есть в «облаке», будут вести к повышению качества обработки любой картинки, которая попадёт на вход, будь это статичное фото или видеопоток. Если что-то и может повлиять негативно, то тот факт, что люди будут больше обмениваться электронной информацией.

- По сути, уже сейчас все документы набираются на компьютере.

- В последние несколько лет в США несколько уменьшаются объёмы производимой бумаги, но не объёмы генерации этой бумаги, если мы говорим о бизнес-транзакциях. Почему-то люди предпочитают физические носители. Если говорить о России, то я думаю, что у нас в ближайшее десятилетие будет только подъём бумажных носителей — как в повседневной жизни, так и в бизнесе. Тем более что необработанных архивов ещё великое множество. Но в итоге, конечно, электронный обмен данными приведёт к тому, что некоторые сценарии, скорее всего, отомрут и определённые данные будут храниться только в электронном виде. Но технология распознавания и там может оказаться полезной — к примеру, если вам из файла PDF нужно извлечь структурированную информацию. Можно попробовать извлечь текст, но по опыту могу сказать, что PDF настолько по-разному генерируются разными программами, что проще будет этот документ превратить в картинку и распознать.

Читать дальше
Тёмная тема
Сбросить

Интервал:

Закладка:

Сделать


Коллектив Авторов читать все книги автора по порядку

Коллектив Авторов - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки LibKing.




Цифровой журнал «Компьютерра» № 135 отзывы


Отзывы читателей о книге Цифровой журнал «Компьютерра» № 135, автор: Коллектив Авторов. Читайте комментарии и мнения людей о произведении.


Понравилась книга? Поделитесь впечатлениями - оставьте Ваш отзыв или расскажите друзьям

Напишите свой комментарий
x