37 миллионов старых газетных страниц выложены в Сеть
Опубликовано сб, 24/12/2016 - 09:19 пользователем DeMorte
Forums: Как создать самый большой архив периодики в домашних условиях? Американец Том Триниски просто вооружился сканером и взялся за дело в собственной гостиной. Работая в одиночку, Том Триниски сумел оцифровать более 37 миллионов страниц старых газет — это больше, чем в американской Библиотеке Конгресса (крупнейшая библиотека мира), — сообщает Newtonew. Результаты своего труда он выкладывает в открытый доступ на сайте Fulton History, где можно найти архивы более 1000 газет штата Нью-Йорк, некоторых других штатов и Канады. В архиве, который составитель регулярно обновляет, содержатся издания с 1795 по 2007 год. Триниски — инженер на пенсии и любитель старины. Над сайтом и контентом он работал в одиночку, в своём доме. Четырнадцать лет назад он решил отсканировать коллекцию старых открыток с видами округа Фултон, Нью-Йорк (его родной район), чтобы поделиться ими в интернете. Впоследствии к открыткам добавились заметки, рекламные объявления, некрологи, печатные издания. Ресурс до сих пор называется в честь округа Фултон, хотя материалы давно вышли за первичные географические границы. Для оцифровки газет используется программа для оптического распознавания символов, которая иногда ошибается из-за того, что некоторые издания очень старые. Также создатель сайта задействовал микрофильмы, на которых есть следы царапин и пыли, однако это добавляет старым газетным страницам обаяния. Сайт Fulton History не всегда справляется с наплывом гостей, и временно бывает недоступен из некоторых точек мира. Если такое случилось, можно заглянуть на Chronicling America, ещё один открытый ресурс с историческими газетами, на сайт с архивами газет от Бруклинской публичной библиотеки, или прошерстить базу данных Нью-Йоркской публичной библиотеки — здесь тоже есть множество старых изданий, и не только американских.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Океана RE:Подайте бедному копеечку на книжку с литреса... 6 часов
Саша из Киева RE:Подвиг героев - судьба страны. МНР: люди и годы 2 дня commodore RE:Письма 1 неделя Саша из Киева RE:Три минуты истории 1 неделя nehug@cheaphub.net RE:Как бы с этим побороться и побороть? 3 недели Саша из Киева RE:Книги на латышском языке 3 недели stevecepera RE:Список современных французских писателей? 1 месяц etorus2008 RE:Отв: Помогите найти книгу по описанию 1 месяц lemma7 RE:Чёрный нимб и другие истории, исполненные неизъяснимого ужаса 1 месяц Wedmak RE:Помогите найти!.. #2 1 месяц sem14 RE:Координация сканирования и вычитки 1 месяц babajga RE:Кто сможет раздобыть и оцифровать нужные мне книги? 1 месяц Isais RE:Мои открытия 1 месяц kopak RE:О группе Дятлова. О той самой, того самого... 1 месяц A5. RE:Не присылает пароль на почту 2 месяца babajga RE:Плюмаж 2 месяца babajga RE:Блошкинс и Фрю. Опасное путешествие 2 месяца alexk RE:Багрепорт - 2 2 месяца Впечатления о книгах
nik_ol про Луганцева: Бесплатный сыр для второй мышки [litres] (Иронический детектив, Детективы: прочее)
12 06 Хочу новое! Если есть, выложите, плииз. ) Оценка: хорошо
alexk про Карнеги: Как сделать свою жизнь легкой и интересной (Психология, Самосовершенствование, О бизнесе популярно, Управление, подбор персонала)
12 06 Новая работа? Карнеги умер 70 лет назад!
Barbud про Каталкин: Несознательный (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
11 06 Кое-как домучил первую часть, за вторую, наверное, не возьмусь. Скучный производственный роман, причем абсолютно "безлюдный" - в книге нет ни одного живого человека, только какие-то юниты безмысленные и безэмоциональные. Автору ……… Оценка: плохо
Lora про Алмазов: Лекарь Его Величества (Боевая фантастика, Фэнтези, Самиздат, сетевая литература)
11 06 Поставлю неплохо. Мери Сью В мужском обличии. Роялей столько, что кустов не видать. Но что-то в этом есть. Оценка: неплохо
miri.ness_ про Ерофеев: Великий Гопник. Записки о живой и мертвой России (Современная проза, Контркультура)
11 06 Если человек не может обойтись без табуированных слов, так или иначе относящихся к процессу размножения, он жалок ничтожен; должен быть подвергнут кровавой экзекуции плетьми с последующим остракизмом - белых мишек кормить. Оценка: нечитаемо
Sello про Каневский: …а бес в ребро! (Современная проза)
11 06 Не очень, и даже - очень не очень. Автор "Тэзы", действительно известного в свое время и смешного произведения, похоже, исписался. Повторение мыслей - через страницу, нестыковки (герой, например, собирающейся разводиться с ……… Оценка: плохо
awas про Ольга Оборзевшая (Тонина)
10 06 Тонина с Афанасьевым всегда были склонны к мрачному юмору, а тут в самом начале книги почти открытым текстом разъяснили, что пишут пародию. Да и администрация ЛибРусЭк совсем уж открытым текстом написала «Юмористическая фантастика, ………
Sello про Фурцева: «Я плачу только в подушку». Откровения «первой леди СССР» [litres] (Биографии и Мемуары)
10 06 Какое-то неоднозначное впечатление оставило чтение этого текста. С одной стороны, понимаешь, что человек пишет с явной целью "отметиться" для последующих поколений (о чем сама Фурцева в конце записей признается), потому - ……… Оценка: неплохо
decim про Фёдор Олегович Ковалов
10 06 Быт и люди психбольницы во имя Св. Николая, она же Пряжка. Рисунки автора. Хорошо. Господа цензоры, замазанные вами слова только подогревают интерес малолетних - взрослые давно узнали и миновали - к известным темам.
udrees про Вальтер: Стадия Уныния (Боевая фантастика, ЛитРПГ, Самиздат, сетевая литература)
10 06 Мрачная писанина про приключения попаданца-маньяка в мир какой-то изуверской игры на выживание. Персонаж у нас антигерой, отрицательный типок, любящий кровь и убийства. Сама книга написана простым языком, без особых описаний. ……… Оценка: неплохо
udrees про Вальтер: Генетический потенциал (Боевая фантастика, Космическая фантастика, Постапокалипсис, Самиздат, сетевая литература)
10 06 2-я книга про жизнь бывшего уголовника на неизвестной планете, где его посвятили в тайну жизни планеты. В общем сюжет круто меняется во второй книге, и то, что кажется понятным в начале книги, в конце полностью меняется на ……… Оценка: неплохо
udrees про Вальтер: Среди нас 1 (Боевая фантастика, Приключения: прочее, Постапокалипсис, Самиздат, сетевая литература)
10 06 В общем то годное произведение, написано даже кажется лучше чем большинство других от Макса Вальтера, а то у автора какая-то тяга к описаниям приключений всякой мрази, маньяков-убийц, антигероев. Здесь же повествование идет ……… Оценка: неплохо |
RE:37 миллионов старых газетных страниц выложены в Сеть
Вот это мужик! Респект и уважуха!
От будут ли правообгладатели ему втыкать за использование материалов?
RE:37 миллионов старых газетных страниц выложены в Сеть
Из FAQ_HELP_INDEX:
В. Могу я добавить статью на этот сайт?
О. Ага. Если газета была опубликована в штате Нью-Йорк и не попадает под копирайт...
===
И на первой странице:
Мери Крисмас, библиотекарь!
RE:37 миллионов старых газетных страниц выложены в Сеть
Ну если оно в сети, тогда и все смогут загребти себе. Вот и если начнется массовое пополнение библиотек газетами...
RE:37 миллионов старых газетных страниц выложены в Сеть
Что-то сильно я сомневаюсь что именно 37 млн страниц газет, скорее всего. как пишут в статистике больших библиотек "единиц хранения" - отдельных открыток, рекламных обьявлений и т.д.
Попробуем посчитать.
37 000 000 / 14 лет = 2 642 000 страниц в год / 365 дней = 7 241 страница в день /12 часов = 600 стр в час или 6 страниц в минуту.
Многовато выходит, и это чисто сканирование. + какая-никакая обрезка + каталогизация + выкладка в Сеть.
RE:37 миллионов старых газетных страниц выложены в Сеть
Дети помогали. Или еще кто то.
А какие там страницы, может не такие как у нас. Тогда по несколько страниц за проход.
RE:37 миллионов старых газетных страниц выложены в Сеть
А можно задать вопрос: вы сами пробывали сканировать газеты?
RE:37 миллионов старых газетных страниц выложены в Сеть
Нет.
Но при современному оборудовании много чего возможно.
RE:37 миллионов старых газетных страниц выложены в Сеть
Расчёт - правильный. В исходных статьях ещё написано, что дедуля в последние три года оцифровывает по 250 000 страниц в месяц - те же самые 6 страниц в минуту (если считать, что он работает 24 часа в сутки, не питаясь и не отлучаясь в туалет).
Я тоже заинтересовался гигантскими цифрами в заметке и немного посчитал. А потом полез на англоязычные сайты и все странности исчезли. Всё гораздо проще.
С бумажными газетами дед недолго поработал в самом начале проекта - в 2001-2003 годах, когда у него был только планшетный сканер.
После этого он приобрёл мощный автоматический сканер для обработки микрофильмов (Wicks and Wilson Scanstation production-level microfilm scanner), наладил взаимодействие с библиотеками и запустил поточное производство. Так что последние 14 лет он оцифровывал микрофильмы, а не сами газеты.
Работает дед по 70-80 часов в неделю, и его работа заключается в том, чтобы распаковать привезённые ему микрофильмы, вставить их в мощный сканер-автомат и получить на выходе готовые сканы, практически не требующие дополнительной обработки. Их сразу можно отправлять на сайт.
Так что основную работу проделали десятки библиотекарей, десятилетиями превращавшие бумажные газеты в микрофильмы. А дед пользуется результатами их титанического труда. Это, конечно, не умаляет его заслуг - но объясняет его небывалую для сканировщика "производительность"...
Подробности - здесь:
http://www.thecrowleycompany.com/long-time-client-uses-wwl-scanners-digitize-26-million-newspaper-images/