Читать книгу Big data изменяют Китай - - Страница 5
ГЛАВА 1. ПРОШЛОЕ И НАСТОЯЩЕЕ БОЛЬШИХ ДАННЫХ
1.3. Социальные медиа: всеобщий вклад, или Как каждый из нас производит данные
ОглавлениеПодлинный «взрыв данных» произошёл в эпоху социальных медиа.
С 2004 года на свет одно за другим стали появляться социальные медиа, например: Facebook и Twitter, – что стало толчком к началу новейшей эры в истории Интернета – Веб 2.0. До этого основное назначение Интернета состояло в распространении и совместном использовании информации, главной формой организации чего были интернет-сайты. Однако сайты статичны. С наступлением эры Web 2.0 Интернет начал становиться проводником для происходящих в реальном времени взаимодействия, коммуникации и коллаборации.
Помимо обеспечения невероятного по уровню роста возможностей для взаимодействия и коллаборации ещё одна важная роль социальных медиа состоит в предоставлении площадки для бесчисленного количества пользователей Интернета со всего мира, благодаря чему они могут в любое удобное время и в любом удобном месте фиксировать свои поступки и мысли. Это фиксирование, по сути своей, и является тем, что вносит вклад в производство данных. Выше мы уже говорили о том, что все данные являются искусственно произведёнными, все данные – это выполняемые нами в отношении реального мира измерения, фиксации и вычисления. Начиная с 1946 года, когда с изобретением вычислительного устройства человечество вошло в информационную эру и ещё не были созданы социальные медиа, данные главным образом производили и собирали информационные системы и датчики. Однако в связи с внезапным появлением социальных медиа человек начал и сам производить данные в Интернете. Публикуемые пользователями записи в Weibo и отправляемые ими через WeChat сообщения, фиксирующие личные действия и поступки, – такие данные получили название «поведенческие», их отношение к другим типам данных показано на рисунке 1.6.
Благодаря появлению социальных медиа пользователи Интернета со всего мира начали становиться создателями данных. Каждый из нас, будто информационная система или датчик, непрерывно создаёт данные. Это повлекло за собой беспрецедентный по своему размаху «взрыв данных».
Помимо резкого увеличения объёма данных социальные медиа привели также к усложнению устройства вселенной данных. Кто-то, создавая пост в микроблоге, прикрепляет изображение, кто-то – видео, произведённые ими данные и по размеру, и по структуре совершенно различны. В связи с отсутствием строгой структуры данные, созданные в социальных медиа, называются также неструктурированными.
Рисунок 1.6. Разные данные с точки зрения размера и типа
Примечание: взаимное влияние разных типов данных. Коммерческие данные могут естественным образом содержать в себе и производить данные о поведении человека и окружающей природной среде, точно так же данные о поведении человека и окружающей природной среде являются взаимовключающимися, перекрёстными и взаимовлияющими. В прошлом мы фиксировали что-либо, только предварительно выбрав, что именно должно быть зафиксировано. В эпоху больших данных мы выбираем то, что зафиксировано быть не должно, и затем удаляем запись об этом. По мере непрерывного расширения сферы фиксирования можно быть уверенным: в будущем совокупный объём данных, имеющихся в распоряжении человека, будет нарастать подобно снежному кому.
Обработка подобных данных несопоставимо сложнее, чем обработка данных, имеющих строгую структуру. 15 марта 2019 года сервис микроблогов Sina Weibo опубликовал «Отчёт о развитии пользователей Weibo в 2018 году», согласно которому по состоянию на четвёртый квартал 2018 года среднее количество текстов, которые пользователи сервиса публиковали в сутки, составил 130 миллионов, среднее количество публиковавшихся за сутки изображений – 120 миллионов, среднее количество публиковавшихся за сутки видео и проведённых прямых эфиров – более 1,5 миллионов. Для сравнения: суммарный объём информации, опубликованной New York Times за прошедшие пятьдесят лет, не превышает 3 миллиардов слов.
Учитывая беспрецедентную скорость производства данных, примерно 75 % от общемировых данных в настоящий момент – это неструктурированные данные. Оглядываясь назад, мы можем сказать, что появление социальных медиа оказало на большие данные определяющее воздействие. Отталкиваясь от приведённого выше анализа, мы можем принять следующее:
Большие данные = структурированные данные + неструктурированные данные.
Однако, как мы уже упоминали, определение «большой» в понятии «большие данные» указывает не только на большой объём данных, но и на их большую ценность. Ценность же заключается в использовании. Как в случае с погребённой в недрах земли нефтью: она хотя и существовала с глубокой древности, человечество вошло в нефтяную эпоху благодаря тому, что появились технологии её добычи и переработки, – точно так же главная причина начала эпохи больших данных состоит в значительном прорыве и прогрессе в возможностях эти данные использовать.