[NIXP] Apache Software Foundation отметила важную роль, которую сыграли Open Source-инструменты для «панамских документов»

Обсуждение новостей, соответствующих тематике форума

Модератор: Модераторы разделов

Ответить
Аватара пользователя
Dmitry Shurupov
Сообщения: 336
Статус: Open Source geek
ОС: Ubuntu Linux
Контактная информация:

[NIXP] Apache Software Foundation отметила важную роль, которую сыграли Open Source-инструменты для «панамских документов»

Сообщение Dmitry Shurupov »

Некоммерческая организация Apache Software Foundation (ASF) заявила, что продукты с открытым исходным кодом, в частности и в особенности развиваемые под её крылом, сделали возможной расследование по крупной утечке конфиденциальных данных, о которой стало известно в прошлом году как о Панамских документах (Panama Papers). В 2015 году немецкая газета SГјddeutsche Zeitung получила от анонимного источника огромный архив данных — 11,5 миллионов файлов общим объёмом в 2,6 терабайта, в которых упоминалось множество мировых лидеров и высокопоставленных чиновников. После продолжительного анализа данных, проводимого 400 журналистами с 6 континентов на протяжении более года, некоторые данные из этого архива начали публиковаться для широкой общественности, что стало огромным событием для мира журналистики и политики. Недавно эта работа была удостоена Пулитцеровской премии 2017 года в категории журналистики (Explanatory Reporting). Как сообщает ASF, обработка информации в 214 888 документах стала возможной благодаря использованию ряда Open Source-утилит, поддерживаемых в этом фонде:


  • Tika — для обработки документов (извлечения метаданных и структурированного текста);
  • Solr — для поиска и индексации текста;
  • PDFBox — для распознавания текста в PDF-документах;
  • POI — для извлечения и управления документами в форматах Excel, Word и PowerPoint;
  • Commons — для ускорения разработки инструментов, предназначенных для работы с документами.

Называя эти проекты интегральной частью расследования, ASF уточняет, что в проекте работы с «панамскими документами» были задействованы и другие Open Source-приложения включая Tesseract-ocr для распознавания текста (в изображениях), Project Blacklight и Jackcess (для чтения и записи баз данных в формате MS Access).
По-моему, это еще один повод перейти на Убунту.
Спасибо сказали:
Ответить