Light-industry-up.ru

Экосистема промышленности

ReCAPTCHA

30-08-2023

Логотип reCAPTCHA.

reCAPTCHA — система, разработанная в университете Карнеги — Меллон для защиты веб-сайтов от интернет-ботов, и одновременной помощи в оцифровке текстов книг. Является продолжением проекта CAPTCHA[1]. В сентябре 2009 года reCAPTCHA была приобретена компанией Google. На начало 2011 года, reCAPTCHA осуществляла оцифровку архивов газеты «The New York Times» и книг, доступных в Google Book Search.

Весной 2012 года Google запустил эксперимент по распознаванию изображений из Google Maps с помощью сервис ReCAPTCHA[2].

Принцип работы

В отличие от традиционных систем распознавания пользователя как человека, путём введения определённого набора символов и цифр, система reCAPTCHA предлагает пользователю ввести два слова. Одно из них уже распознано и известно системе, другое слово системе неизвестно и не может быть распознано программой распознавания текста. Проверка ввода осуществляется по тому слову, которое известно системе. Неизвестное системе слово, введённое пользователем, сохраняется и используется в качестве возможного варианта распознания. Конечное распознание слова определяется путём вычисления наиболее часто используемого слова для ввода. Система reCAPTCHA предоставляет изображения для распознавания и собирает результаты, после чего передает их организаторам оцифровки материалов[1].

Влияние

Система reCAPTCHA широко используется такими сайтами как Facebook, TicketMaster (англ.)русск., Twitter, bash.im, StumbleUpon, «Живой журнал» и примерно 350 000 других сайтов. В день оцифровывается примерно 100 миллионов слов, что может давать примерно 2,5 миллиона книг в год. Количество отдельных людей, которые помогли оцифровать как минимум одно слово из книги оценивается в 750 миллионов человек[1]. Эффективность подобного метода достаточно высока, поскольку системе предоставляется несколько распознанных вариантов.

Поскольку слова выводятся в случайном порядке, то неизбежно возникают курьёзные сочетания слов. Это породило интернет-мем «Inglip», когда люди делают снимок экрана двух слов предоставленных системой reCAPTCHA и дорисовывают курьёзные рисунки[1].

Частичный обход

Обычно пользователю предлагается два слова, одно из которых является словарным английским, а другое — нет. Для прохождения теста достаточно ввести только не словарное слово. Начиная с мая 2011 года, нужное слово выводится при помощи двойного наложения контура букв друг на друга. С недавних пор нужное слово выводится при помощи наложения на слово волнообразной линии.

Критика

reCAPTCHA используется для распознавания отсканированных текстов. Вводящие ответ пользователи вынуждены вводить примерно вдвое больше текста, чем в других системах CAPTCH’и, но не получают за это никакого вознаграждения, а весь доход от использованного распознанного текста остаётся корпорации Google, что расценивается некоторыми как принудительная эксплуатация труда.

Тем не менее, держатели сайтов вправе оставить за собой выбор способа защиты от ботов.

Помимо этого reCAPTCHA подвергается критике пользователей из-за того, что картинки с трудом распознаются даже человеком.

Пользователь не обязан вводить оба слова. Одно из них не проверяется, узнать его довольно легко: в разное время проверяемое слово «зашумлялось» двойным контуром или волнообразной линией. К тому же в непроверяемое слово иногда попадают знаки препинания, текст на других языках, математические формулы и т. п. Также у непроверяемого слова возможна инверсия цветов фона и букв. На имиджбордах выдвигаются предложения саботировать работу reCAPTCHA вводом ругательств: если достаточное количество пользователей укажут одно и то же ругательство, система, вероятно, внесёт его в электронный документ.

Ссылки

  • Официальный сайт системы reCAPTCHA  (англ.)
  • Luis von Ahn, Benjamin Maurer, Colin McMillen, David Abraham and Manuel Blum reCAPTCHA: Human-Based Character Recognition via Web Security Measures // Science. — 12.09.2008. — В. Vol. 321 no. 5895 pp. 1465-1468. — 10.1126/science.1160379
  • Луис фон Ан: Массовое онлайн-сотрудничество // конференция TED, 2011
  • Патент на Google patents.
  • Hutchinson Alex ReCAPTCHA: The job you didn't even know you had. The Walrus (29.03.2012).
  • reCAPTCHA установка и получение ключей

Примечания

  1. ↑ Луис фон Ан: Массовое онлайн-сотрудничество // конференция TED, 2011
  2. Google Now Using ReCAPTCHA To Decode Street View Addresses (29.03.2012). Архивировано из первоисточника 18 августа 2012. Проверено 14 августа 2012.

ReCAPTCHA.

© 2014–2023 light-industry-up.ru, Россия, Краснодар, ул. Листопадная 53, +7 (861) 501-67-06