Я мог попробовать проделать всю работу в Google, но я решил скачать их в Microsoft Excel и после этого отсортировать по возрастанию, чтобы найти ответы, в которых люди написали числа прописью, и исправить их. Я решил постараться исключать как можно меньше вариантов. Поэтому вместо того, чтобы принимать только действительные ответы, я пытался исправлять остальные. Люди использовали иностранные валюты, и я переводил их в фунты стерлингов, что было довольно утомительно.
Однако в целом анализ занял всего несколько часов, и в итоге я отмел все очевидно неуместные ответы. Многие люди решили заполнить форму, отметив при этом, что они ничего не платили за билеты. Забавно, но ладно. Таких оказалось менее сотни из более чем семи тысяч респондентов.
Несколько десятков человек написали откровенно большие суммы в попытке исказить результаты. Например, десять миллионов фунтов стерлингов. Оставшийся набор ответов я мог обрабатывать, исходя из обычных принципов работы с данными. Я сделал так называемую сводную таблицу. Я вывел средние значения. И т. д.
Мы не знали, какой ход наберет этот проект, поэтому над ним работали только я и редактор спортивного блога. Мы сели, подумали и решили, что этот проект может оказаться интересным. На весь проект, от начала до конца, у нас ушло 24 часа. У нас появилась идея, мы поразмышляли над ней за обедом, мы разместили форму на сайте, мы увидели, что идея пользуется популярностью, мы продержали форму на сайте до конца дня и на следующее утро поместили в сети ее результаты.
Выбор в пользу сервиса Google Docs был сделан потому, что он позволяет полностью контролировать результаты. Мне не пришлось пользоваться каким–то сторонними аналитическими инструментами. Я мог с легкостью поместить результаты в базу данных или в таблицу. Когда вы используете специальное программное обеспечение для опросов общественного мнения, вы зачастую можете использовать только предусмотренные им инструменты. Если бы информация, которую мы хотели собрать, требовала какого–то деликатного обращения, то мы могли бы не прибегать к сервисам Google и попробовать справиться со всем своими собственными силами. А в целом оказалось очень просто разместить форму Google Form на странице Guardian, при этом пользователю было практически не видно, что именно мы используем. Так что это оказалось очень удобно.
В качестве совета журналистам, работающим в сфере данных, которые хотят использовать краудсорсинг: вы должны очень точно знать, какую информацию вы хотите получить. Задавайте вопросы, которые могут иметь очень большое количество разных ответов. Попробуйте понять демографию аудитории, к которой вы обращаетесь, чтобы понять, не является ли ваша выборка предвзятой. Если вы спрашиваете о суммах и других подобных вещах, попробуйте указать, что ответ должен быть в цифрах, что пользователи должны использовать определенную валюту т. п. Многие все равно не выполнят эти указания, но чем больше вы регламентируете этот процесс, тем будет лучше. И всегда, всегда добавляйте поле для комментариев, так как большое количество людей заполнят поля опроса, но при этом им очень хочется довести до вас свое мнение по данному вопросу. Особенно если речь идет о нарушениях прав потребителей или произволе.
— Интервью Джеймса Болла, журналиста Guardian, Марианне Баучарт, блог «Data Journalism»
Использование и обмен данными: готический шрифт, мелкий шрифт и реальность
В данном разделе мы кратко рассмотрим положения законодательства о данных и базах данных, и посмотрим, что вы можете сделать, чтобы открыть ваши данные, используя имеющиеся общедоступные лицензии и правовые инструменты. Не позволяйте ниже перечисленным преградам ослаблять ваше стремление к журналистике, посвященной данным. Обычно вы не будете сталкиваться с правовыми ограничениями при использовании данных, и вы можете легко сделать так, чтобы они не мешали другим людям пользоваться опубликованными вами данными.
Следует признать, что сейчас добывать данные стало просто, как никогда. Раньше, до эпохи широкой публикации данных в Интернете, даже если вы обнаруживали нужную вам базу данных, вы должны были просить того, у кого она находилась, предоставить вам доступ к ней, отправляя для этого письмо или совершая личный визит. Теперь ваш компьютер просит другой компьютер отправить ему нужную копию . Это, конечно, очень упрощенная схема, но в настоящее время у вас есть право на копирование, а они (лица, создавшие или опубликовавшие данные) ничего не сделали и, возможно, даже не знают, что вы скачали себе копию.
Читать дальше