37 миллионов старых газетных страниц выложены в Сеть
Опубликовано сб, 24/12/2016 - 09:19 пользователем DeMorte
Forums: Как создать самый большой архив периодики в домашних условиях? Американец Том Триниски просто вооружился сканером и взялся за дело в собственной гостиной. Работая в одиночку, Том Триниски сумел оцифровать более 37 миллионов страниц старых газет — это больше, чем в американской Библиотеке Конгресса (крупнейшая библиотека мира), — сообщает Newtonew. Результаты своего труда он выкладывает в открытый доступ на сайте Fulton History, где можно найти архивы более 1000 газет штата Нью-Йорк, некоторых других штатов и Канады. В архиве, который составитель регулярно обновляет, содержатся издания с 1795 по 2007 год. Триниски — инженер на пенсии и любитель старины. Над сайтом и контентом он работал в одиночку, в своём доме. Четырнадцать лет назад он решил отсканировать коллекцию старых открыток с видами округа Фултон, Нью-Йорк (его родной район), чтобы поделиться ими в интернете. Впоследствии к открыткам добавились заметки, рекламные объявления, некрологи, печатные издания. Ресурс до сих пор называется в честь округа Фултон, хотя материалы давно вышли за первичные географические границы. Для оцифровки газет используется программа для оптического распознавания символов, которая иногда ошибается из-за того, что некоторые издания очень старые. Также создатель сайта задействовал микрофильмы, на которых есть следы царапин и пыли, однако это добавляет старым газетным страницам обаяния. Сайт Fulton History не всегда справляется с наплывом гостей, и временно бывает недоступен из некоторых точек мира. Если такое случилось, можно заглянуть на Chronicling America, ещё один открытый ресурс с историческими газетами, на сайт с архивами газет от Бруклинской публичной библиотеки, или прошерстить базу данных Нью-Йоркской публичной библиотеки — здесь тоже есть множество старых изданий, и не только американских.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
nezhit RE:Подайте бедному копеечку на книжку с литреса... 24 мин.
larin RE:Пропал абонемент 2 дня Larisa_F RE:Серия "Новые сказочные повести" издательство "Самовар" ... 2 недели sem14 RE:Серия "Символы времени" издательства "Аграф" 2 недели Larisa_F RE:Серия книг «Судьбы книг» издательства «Книга» 2 недели tvv RE:faq brainstorm =) 3 недели Larisa_F RE:Серия "Что есть что" издательства "Слово"(чего не хватает) 3 недели Larisa_F RE:Серия "Очень прикольная книга", издательство Азбука-классика 3 недели larin RE:абонемент не обновлен 4 недели sem14 RE:За иллюминатором (серия) - чего не хватает? 1 месяц sem14 RE:Собираем серию: "Мастер серия", издательство "Лимбус". 1 месяц Larisa_F RE:Книжная серия «Сlio» издательства "Евразия" 1 месяц tvv RE:DNS 1 месяц MrMansur RE:<НРЗБ> 1 месяц Stager RE:Беженцы с Флибусты 1 месяц Tramell RE:Серия "Библиотека французской литературы" (Макбел) 1 месяц sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 месяц sem14 RE:Современная корейская литература. Книжная серия... 1 месяц Впечатления о книгах
Barbud про Емельянов: Бастард Александра (Альтернативная история, Исторические приключения, Попаданцы, Самиздат, сетевая литература)
13 02 Вполне читабельно. Местами, правда, несколько затянуто и изрядно сдобрено размышлизмами в ущерб "экшену", но в целом неплохо. Немного позабавило нежелание ГГ браться за внедрение огнестрела на том основании, что порох, будучи ……… Оценка: хорошо
Олег Макаров. про Кириллов: Вернуться (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
12 02 Диван, на котором он лежал, стоял в углу, впритык к стенке торцом и одной из сторон, прямо рядом с закрытой дверью. Прямо напротив него рядом с окном стоял письменный стол. У противоположной стены стояла большая мебельная ……… Оценка: нечитаемо
su24i про Кулаков: Цивилизатор в СССР 1978 (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
12 02 Э-э-э... я думаю Дунька Кулакова сестра автора.... Оценка: нечитаемо
Oleg68 про Сергей Дмитриевич Ауслендер
11 02 Отлично. Настольная книга для тех, кто опустил руки и не борется. Автору уважение.
austvalya про Емец: Таня Гроттер и посох Волхвов (Детская фантастика)
11 02 Жалко Таню. А Лизу жалеть не хочу, она завистлива и эгоистична. Да и преподаватели в этой книге показали себя не с лучшей стороны. Оценка: хорошо.
Sello про Голдсуорти: Во имя Рима: Люди, которые создали империю [In the Name of Rome: The Men Who Won the Roman Empire ru] (История)
11 02 Интереснейшая книга. Правда, стоит свою память держать все время в "боеготовности": в лабиринте дат, имен (второстепенных), которые у разных персонажей порой абсолютно одинаковые, названий населенных пунктов запутаться несложно. Оценка: отлично!
decim про Аллингем: Сладкая опасность (Классический детектив)
11 02 Качество перевода, увы, никакое. Более приличный перевод см. "Сладость риска", изд. "Азбука", 2025.
tvv про Гаглоев: Кефир, Гаврош и Рикошет. Дело о пропавшей бабушке [litres] (Детская фантастика, Детские остросюжетные, Детские приключения)
10 02 Вторая книга серии в литресовском качестве есть на Флибусте, но она чуть больше 10 мегабайт (((
mysevra про Дорман: Подстрочник: Жизнь Лилианны Лунгиной, рассказанная ею в фильме Олега Дормана (Биографии и Мемуары)
09 02 Смотреть Лунгину мне интереснее, а читать понятнее. Замечательный специалист и женщина, перед которой я преклоняюсь: интеллигентность и эрудиция, помноженные на стойкость. Оценка: отлично!
mysevra про Дэникен: Боги майя. Тайные послания пришельцев [День, когда явились боги] (Культурология, Публицистика)
09 02 Пишет легко и увлекательно. Можно, конечно, критиковать теорию палеоконтакта, но тогда надо предложить свою правдоподобную версию. Только удивило, что при рассказе о расшифровке письменности упоминались какие угодно исследователи, ……… Оценка: хорошо
mysevra про Клочков: Лунь (Боевая фантастика)
09 02 Это как-то больше про любовь. А я приключений хотела. Вообще, как бы грубо это не прозвучало, книги этой серии хороши без женских персонажей «со всеми вытекающими из этого последствиями». Оценка: неплохо
DGOBLEK про Найт: Мастера эволюции (Фантастика: прочее)
08 02 ЭТО МОЖТ ОБУЧИТЬСЯ С ТОПОЙ! - название рассказа....Mefisto - ну как так можно делать спустя рукава электронку? Взялись делать FB2 - делайте хорошо. Название рассказа - Это можт свучиться с топой! Если в оглавлении допускать ……… |
RE:37 миллионов старых газетных страниц выложены в Сеть
Вот это мужик! Респект и уважуха!
От будут ли правообгладатели ему втыкать за использование материалов?
RE:37 миллионов старых газетных страниц выложены в Сеть
Из FAQ_HELP_INDEX:
В. Могу я добавить статью на этот сайт?
О. Ага. Если газета была опубликована в штате Нью-Йорк и не попадает под копирайт...
===
И на первой странице:
Мери Крисмас, библиотекарь!
RE:37 миллионов старых газетных страниц выложены в Сеть
Ну если оно в сети, тогда и все смогут загребти себе. Вот и если начнется массовое пополнение библиотек газетами...
RE:37 миллионов старых газетных страниц выложены в Сеть
Что-то сильно я сомневаюсь что именно 37 млн страниц газет, скорее всего. как пишут в статистике больших библиотек "единиц хранения" - отдельных открыток, рекламных обьявлений и т.д.
Попробуем посчитать.
37 000 000 / 14 лет = 2 642 000 страниц в год / 365 дней = 7 241 страница в день /12 часов = 600 стр в час или 6 страниц в минуту.
Многовато выходит, и это чисто сканирование. + какая-никакая обрезка + каталогизация + выкладка в Сеть.
RE:37 миллионов старых газетных страниц выложены в Сеть
Дети помогали. Или еще кто то.
А какие там страницы, может не такие как у нас. Тогда по несколько страниц за проход.
RE:37 миллионов старых газетных страниц выложены в Сеть
А можно задать вопрос: вы сами пробывали сканировать газеты?
RE:37 миллионов старых газетных страниц выложены в Сеть
Нет.
Но при современному оборудовании много чего возможно.
RE:37 миллионов старых газетных страниц выложены в Сеть
Расчёт - правильный. В исходных статьях ещё написано, что дедуля в последние три года оцифровывает по 250 000 страниц в месяц - те же самые 6 страниц в минуту (если считать, что он работает 24 часа в сутки, не питаясь и не отлучаясь в туалет).
Я тоже заинтересовался гигантскими цифрами в заметке и немного посчитал. А потом полез на англоязычные сайты и все странности исчезли. Всё гораздо проще.
С бумажными газетами дед недолго поработал в самом начале проекта - в 2001-2003 годах, когда у него был только планшетный сканер.
После этого он приобрёл мощный автоматический сканер для обработки микрофильмов (Wicks and Wilson Scanstation production-level microfilm scanner), наладил взаимодействие с библиотеками и запустил поточное производство. Так что последние 14 лет он оцифровывал микрофильмы, а не сами газеты.
Работает дед по 70-80 часов в неделю, и его работа заключается в том, чтобы распаковать привезённые ему микрофильмы, вставить их в мощный сканер-автомат и получить на выходе готовые сканы, практически не требующие дополнительной обработки. Их сразу можно отправлять на сайт.
Так что основную работу проделали десятки библиотекарей, десятилетиями превращавшие бумажные газеты в микрофильмы. А дед пользуется результатами их титанического труда. Это, конечно, не умаляет его заслуг - но объясняет его небывалую для сканировщика "производительность"...
Подробности - здесь:
http://www.thecrowleycompany.com/long-time-client-uses-wwl-scanners-digitize-26-million-newspaper-images/