Хартията пазеше тайните си достатъчно дълго. Сега AI-ят я кара да проговори.
Технологията тръгва от едно съвсем конкретно, човешко желание. През 1976 година американският изобретател Рей Кързуайл (Ray Kurzweil) представя машина, която сканира отпечатана страница и я чете на глас - за да могат незрящи хора да "четат" обикновени книги. Това е първата практична употреба на OCR въобще. Оттогава технологията минава през банки, библиотеки, архиви на съдилища, но десетилетия наред остава тромава и капризна.
Класическият OCR работи като строг разпознавач на форми. Учи се да сравнява всяка буква с еталон и когато формата съвпадне достатъчно точно, я записва. Работи прилично на чисто сканирана страница с познат шрифт. Изкривена снимка от телефон, ръкописен подпис, петно от кафе върху фактура или таблица с накриво подредени колони - и го чупят почти веднага. Резултатът е поредица от грешни символи, които правят целия текст безсмислен.
AI-ят обръща логиката наопаки. Вместо да разпознава изолирани форми, моделът е трениран върху огромен брой снимки на текст и се учи да предполага какво пише от контекста - точно както големите езикови модели, LLM, системи обучени да предвиждат следващата дума в изречение, предполагат следващата дума в разговор. Замъглена ли е буквата, но изречението очевидно продължава с определена дума, моделът я познава по смисъл, не само по форма. Затова днешният OCR чете ръкописен текст, кривнати касови бележки, снимки под лоша светлина и дори страници с таблици и печати, при които старите системи се предаваха.
Тук технологията среща истинската си работа: цялата хартия по света. Договори в шкафове, болнични картони, стари писма, архиви на общини, счетоводни документи - всичко това внезапно може да се превърне в търсим дигитален архив, вместо да стои заключено в папка, която никой няма да отвори отново. Безплатни инструменти с отворен код като Tesseract вършат основната, груба работа от години, но AI моделите добавят разбирането, което липсваше.
Има и цена на тази лекота. Моделът, който "предполага" смисъл вместо да разчита буквално, понякога предполага грешно - и звучи напълно уверено в грешката си. За снимка на бележка това е дребен риск. За медицинско направление, съдебен документ или договор с числа е различен въпрос. Грешката изглежда като истина, докато някой не провери оригинала.