Применение

DjVu для сканов, книг и электронных библиотек: где он силён

Форматы приходят и уходят, но один до сих пор хранит наследие целой эпохи оцифровки. DjVu давно не развивается, а браузеры о нём забыли — и всё же миллионы книг продолжают жить именно в нём. Разбираемся, почему так вышло, где формат был незаменим и в каких уголках интернета он силён до сих пор.

Высокие стеллажи старинной библиотеки с золотыми буквами на торцах — образ цифрового архива
DjVu стал негласным форматом цифровых библиотек — и до сих пор хранит их наследие. Фото: Pexels

Формат, рождённый под задачу эпохи

Чтобы понять, почему DjVu стал таким, каким стал, надо мысленно вернуться в конец 1990-х — начало 2000-х. Широкополосного интернета почти нет, большинство выходит в сеть через медленный модем, а энтузиасты и библиотеки мечтают оцифровать книжные фонды и выложить их в открытый доступ.

Проблема была в размере. Качественный скан книжной страницы в JPEG весил сотни килобайт, а целая книга — десятки мегабайт. Скачивать такое по модему было пыткой. И тут на сцену выходит DjVu со своим фокусом — разделением страницы на слои и агрессивным сжатием. Книга, которая в JPEG весила бы 50 МБ, в DjVu ужималась до нескольких мегабайт. Внезапно оцифровка стала практичной.

10–25 КБвес одной страницы скана
в 5–10×меньше типичного PDF
2002DjVu в Internet Archive

Электронные библиотеки и Internet Archive

Главным апологетом формата стал Internet Archive — некоммерческая «вечная библиотека» интернета. В 2002 году он выбрал DjVu как один из основных форматов для проекта «Миллион книг» (Million Book Project): сканы общедоступных изданий выкладывались в DjVu, чтобы их было легко и быстро скачать. К 2011 году в архиве оцифровали уже миллионы текстов, и значительная часть была доступна именно в этом формате.

Логика была железной: DjVu давал маленький файл при хорошем качестве, позволял искать слова прямо по тексту книги (за счёт распознавания текста, OCR) и легко открывался прямо в браузере с помощью специальных дополнений. Для эпохи, когда трафик стоил денег, а скорости были скромными, это было идеальным решением. Так DjVu стал негласным стандартом цифровых библиотек начала века.

Корешки советских книг с кириллицей на полке — фонды, которые массово оцифровывали в DjVu
В русскоязычном сегменте в DjVu массово сохраняли учебники, монографии и справочники. Фото: Pexels

Где DjVu силён до сих пор

Несмотря на то что развитие формата заморожено, он остаётся хозяином в нескольких нишах:

  • Научные и технические архивы. Огромные коллекции статей, диссертаций, справочников и ГОСТов, оцифрованных в 2000-х, так и хранятся в DjVu. Переконвертировать терабайты файлов слишком дорого, поэтому формат живёт.
  • Учебники и образование. Студенческие библиотеки накопили тысячи учебников и методичек в DjVu. Для многих редких изданий это вообще единственная доступная цифровая копия.
  • Редкие и старые книги. Издания, которых давно нет в продаже, энтузиасты сканировали именно в DjVu — ради компактности при хорошей читаемости.
  • Любительская оцифровка. Сообщества книголюбов и сканировщиков годами выкладывали свои труды в этом формате, и архивы продолжают пополняться.

Главная сила — масштаб

Когда коллекция исчисляется десятками тысяч томов, даже скромная экономия места на каждом файле превращается в терабайты. Именно поэтому крупные архивы, однажды выбравшие DjVu, держатся за него: дешевле хранить как есть, чем переделывать всё заново.

Ряд старых томов с золотым тиснением в полумраке — образ научного архива
Научные и технические собрания — главная вотчина DjVu: тысячи томов в компактных файлах. Фото: Pexels

Неожиданная связь с искусственным интеллектом

Вот факт, который удивляет даже тех, кто давно знаком с форматом. Среди создателей DjVu — Янн ЛеКун и Йошуа Бенжио, будущие пионеры глубокого обучения и лауреаты премии Тьюринга — это как Нобелевская премия, только для информатики. DjVu они разрабатывали в AT&T Labs ровно в те годы, когда закладывали основы современных нейросетей.

И это не совпадение. Кодек JB2, сердце DjVu, занимается, по сути, задачей распознавания образов: он ищет на странице повторяющиеся формы — одинаковые буквы — и кодирует каждую уникальную форму один раз. Это идейно близко к тому, как нейросети учатся узнавать паттерны. Получается, скромный формат сканов вырос из той же интеллектуальной среды, что и революция в ИИ.

DjVu создавали те же люди, что позже изменили искусственный интеллект. Сжатие сканов и распознавание образов оказались соседями.

Что делать с DjVu сегодня

Если вы наткнулись на книгу в DjVu, не спешите расстраиваться из-за «непривычного» формата — внутри ценное содержимое. Практичный подход такой:

  • Для чтения и хранения удобнее конвертировать DjVu в PDF: он откроется на любом устройстве, легко печатается и пересылается. Оригинал при желании можно сохранить в архиве как есть.
  • Для новой оцифровки сегодня логичнее сразу сохранять в PDF: современный PDF с разделением слоёв даёт сопоставимый размер, но при этом совместим со всем подряд.

То есть DjVu стоит воспринимать не как «плохой устаревший формат», а как хранителя огромного наследия, которое легко перенести в современный вид одним кликом.

Перенесите книгу из DjVu в современный PDF

Откройте редкое издание из электронной библиотеки на любом устройстве — конвертируйте .djvu в универсальный PDF за пару секунд, бесплатно и в браузере.

Конвертировать DjVu в PDF

Хотите глубже понять технологию? Прочитайте, что такое DjVu и как работает разделение на слои, или сравните форматы напрямую в материале DjVu vs PDF. А если книгу нужно просто открыть — вот гид, чем открыть DjVu на любом устройстве. Все преобразования — на странице форматов.

В 2000-х широкополосный интернет был редкостью, а оцифровать хотелось целые библиотеки. DjVu сжимал сканы в разы сильнее JPEG и PDF, поэтому книга грузилась даже через медленный модем. В 2002 году Internet Archive выбрал DjVu для проекта оцифровки миллиона книг — и формат стал негласным стандартом цифровых библиотек той эпохи.
В размере при хранении огромных коллекций отсканированных книг. Когда счёт идёт на десятки тысяч томов, экономия даже в 20–30% на каждом файле выливается в терабайты. Поэтому крупные архивы, оцифровавшие фонды в DjVu, часто так и оставляют их — переконвертировать всё заново слишком дорого.
В научных и технических архивах, библиотеках оцифрованных учебников, коллекциях редких и старых изданий, у любителей оцифровки книг. Особенно много DjVu в русскоязычном сегменте: в 2000-х в нём массово сохраняли учебники, монографии и справочники.
Да, и довольно неожиданно. Среди создателей DjVu — Янн ЛеКун и Йошуа Бенжио, будущие пионеры глубокого обучения и лауреаты премии Тьюринга. Кодек JB2, который ищет повторяющиеся формы букв на странице, идейно близок к задачам распознавания образов, которыми эти учёные занимались.
Для новых задач — обычно нет: формат заморожен, плохо открывается и не поддерживается браузерами. Если вы оцифровываете книги сейчас, практичнее сразу сохранять в PDF. А уже имеющиеся DjVu удобно конвертировать в PDF для повседневного чтения, сохраняя оригиналы в архиве.