Big Data: medindo e prevendo o comportamento humano

Em 20 de abril foi lançado o curso online massivo e aberto (MOOC: massive online open course) “Big Data: measuring and predicting human behaviour“. Possui a duração de 9 semanas e pode ser iniciado em qualquer momento até a última semana. Ou seja: corra pra fazer, que dá tempo!

Na primeira semana do curso, os professores se dedicam a apresentar o que é big data, especialmente em torno de um projeto desenvolvido pelos próprios professores do curso fazem parte. Suzy Moat e Tobias Preis falam sobre o Future Orientation Index, índice criado para identificar o quanto a população de determinado país se preocupa/planeja/pensa sobre o futuro. O mais interessante deste índice é que ele utiliza basicamente dados do Google Trends. Para cada país analisado (todos com 5mi ou mais de usuários de internet), os pesquisadores extraíram o volume de buscas pelos anos anteriores e anos futuros. O índice calcula se a população está mais voltada ao futuro ou ao passado em suas buscas. O gráfico da direita abaixo mostra considerável correlação entre o índice e o GDP per capita (Gross Domestic Product per capita, ou PIB per capita):

Tela de “Quantifying the Advantage of Looking Forward”, por Preis, Moat, Stanley e Bishop

Na segunda semana, o tema é “Medindo e Prevendo Comportamentos com Big Data”. São vários vídeos realizados pelos dois professores e por outros pesquisadores convidados mostrando seus projtos sobre mecanismos de busca, tecnologias vestíveis e cidades inteligentes. Merece destaque um projeto que me surpreendeu. Paul Lukowics, da DFKI/TU Kaiserslautern, mostra o “Magic Collar”, que tem o objetivo de conseguir medir classes de alimentos sendo engolidos através do som realizado na deglutição.

Nesta semana começam os exercícios práticos, que ensinarão coletas e processamentos simples de dados com o R e R-Studio. Da segunda à sexta semana, são apresentados passos simples de como redigir script para coletar dados históricos de visualização de páginas na Wikipedia. Tudo é realizado extraindo dados de forma organizada do stats.grok.se. Já conhecia e usava o website, mas a criação do script no R expande e aprofunda as possibilidades.

O mercado financeiro é o tema da terceira semana. Os professores e entrevistados da semana mostram exemplos de estudos que relacionam atividades online de busca de informação, como visitas à Wikipedia e busca no Google, como correlacionados a atividades no mercado financeiro. O gráfico abaixo, tela de aula do Tobias Preis, mostra estudo que compara a busca pelos termos Lehman Brothers e Financial Crisis com o índice S&P 500 em torno da crise de 2008.

A quarta semana traz estudos sobre big data, crime e conflito. São aplicações em redução e prevenção de criminalidade, sobretudo a partir da compreensão das dinâmicas de ocorrências nas cidades. Um bom projeto é realizado por Toby Davies, da University College London, que utilizou métricas como intermediaridade de rede para analisar a disseminação de ocorrências.

Mas de particular interesse para os brasileiros é o estudo liderado por Neil Johnson, do Complex Systems Initiative at the University of Miami (oh, a ironia). Johnson procurou descobrir uma fonte de dados que pudesse ajudar a prever o tamanho dos protestos realizados em 2013 no Brasil. O pesquisador explica as dinâmicas encontradas e como se surpreendeu que este dado foi a atividade e crescimento em páginas do Facebook dedicadas à política e protestos.

Durante todo o curso, há atividades específicas de comentários e discussão. A cada semana, os professores e a assistente, Chanuki Seresinhe, publicam um novo vídeo “round-up” para resumir a semana anterior e comentar dúvidas e colaborações dos alunos nos campos de discussões e comentários. Mas a quinta semana levará tudo isto além, incluindo uma seção de Twitter Chat em torno da hashtag #FLBigData. Já há bastante debate e colaborações, como você pode ver no widget abaixo, mas no dia 21 de maio, entre 1-2PM Uk Time (entre 10h-11h da manhã aqui na faixa de horário de Brasília), Suzy e Tobias participarão ao vivo da conversa.

FLBigdata Tweets

Uso do big data para saúde é o tema da interessante sexta semana. O caso mais curioso é o da história da predição efetiva de tendências de gripe através de buscas no Google e a posterior falha do mecanismo em 2013, causada por mudanças no comportamento dos indivíduos.

A sétima semana vai tratar de felicidade! Há projetos baseados tanto em quantified self através de smartphones quanto do que as pessoas falam em Facebook e Twitter, através da identificação de marcadores linguísticos sobre afetividade, positividade e negatividade. Os estudos experimentais realizados pelo Facebook sobre difusão de estados emocionais e sobre predição de atributos através de likes (já escrevi sobre, aqui no blog), também são apresentados.

Nesta semana começa também a série de exercícios no R de redação de scripts para coletar e cruzar os mesmos dados que serviram de base para a criação do Future Orientation Index pelos professores do curso. Os dados de busca, obtidos através do Google Trends, serão cruzados com os dados do CIA World Factbook nos exercícios.

Tratando de mobilidade e desastres, as aulas da oitava semana mostram como smartphones, Flickr e mapas colaborativos tem ajudado pessoas em situações de calamidades naturais. A tela abaixo mostra a correlação entre número de fotografias com hashtags selecionadas referentes ao furacão Sandy e a medição de uma variável ambiental: pressão atmosférica. O número de fotos esteve correlacionado à força do furacão.

Por fim, a nona semana é dedicada especialmente à reflexão e discussão do que foi aprendido. Um dos vídeos da última semana trata de como contar histórias com dados. Apresentado por Adrian Letchford, também da Warwick Business School, discorre sobre o processo de descoberta enquanto conta uma interessante história pessoal. Como exemplo, traz visualizações como a exibida abaixo, que comparou termos de busca em estados dos EUA com maior e menor taxa de natalidade.

Imagino que alguns destes poucos exemplos já devem ter despertado o interesse, não? Então cadastre-se em https://www.futurelearn.com/courses/big-data e participe!

Tarcízio Silva

Pesquisa, ciência, tecnologia e sociedade, racismo algorítmico

Deixe um comentário