Mudanças no monitoramento de Facebook: prepare-se!

Neste primeiro de maio, ironicamente, o Facebook passou a “dificultar” o trabalho dos profissionais da querida área de monitoramento de mídias sociais. Nesta data passaram a valer as novas regras das APIs do Facebook. O principal impacto para o mercado de monitoramento de mídias sociais é que nenhuma ferramenta, nem usuário, poderá fazer coleta de dados brutos a partir de pesquisa de termos. Isto significa que não teremos mais acesso ao texto bruto ou ao perfil dos usuários (nem sequer  nome e avatar!) de quem mencionar as marcas em suas timelines (fora de páginas e grupos).  Somente será possível coletar alguns indicadores e quantificações já processadas, como: número de menções a marcas; número de menções a termos; número de menções a atributos de um produto/serviço; distribuição demográfica de quem fala sobre cada termo buscado; circulação de links etc.

Ilustrando de forma muito simples abaixo: se antes tínhamos acesso a todo o texto, link e avatar do usuário (na esquerda), agora cada post virará “apenas” um número nos gráficos:facebook monitoramento - antes e depois

Os impactos negativos desta mudança são os mais óbvios e imediatos. Em primeiro lugar, as marcas que tentavam descobrir problemas específicos de consumidores individuais através do monitoramento de postagens públicas não poderão mais fazê-lo. Agências e consultorias de pesquisa que realizavam estudos qualitativos baseados no comportamento discursivo/expressivo de usuários não poderão mais fazer isto no Facebook (neste caso há algumas alternativas, mas de menor escala – e assunto pra outro post). Ações de engajamento que envolviam a participação ativa dos usuários em seus próprios perfis também minguarão, pois não será possível monitorar as menções para reportar resultados. Tudo isto traz impactos óbvios para os modelos de serviços e receita de agências e ferramentas.

Mas chorar pelo leite derramado não ajuda. Então vamos aproveitar o que for possível, dadas as condições. Segue uma lista de materiais comentados que pode ajudar muito neste momento de disrupção.

Pra começo de conversa, gostaria de indicar três textos de profissionais que admiro e trabalham com monitoramento há tanto (ou mais) tempo que eu: o Roberto Cassano publicou no Medium da Frog o post “A Era Negra do Monitoramento“, o Eduardo Vasques da TV1 o texto “A Crise do Monitoramento” e o Gabriel Ishida da dp6 com o texto “Sobre a API do Facebook e o seu Topic Data“. Apesar de achar os títulos dos dois primeiros textos prejudiciais, pois tem muita gente que não lê ou se informa com atenção e podem criar um clima apocalíptico, são observações e comentários essenciais. Como comenta o Cassano, “ é preciso desenvolver uma estratégia e uma metodologia, que use ferramentas para se alcançar os objetivos reconhecendo e explorando as enormes limitações e desafios impostos pelas novas plataformas e por uma maior maturidade do próprio consumidor, cada vez mais ciente da (correta) necessidade de preservar sua privacidade.” E, nas palavras do Vasques, é hora de: “Abrir novas frentes de interação e estimular ainda mais o diálogo para que os públicos se manifestem nesses ambientes aos quais as marcas têm acesso. Ou seja, é hora de se abrir para novos aprendizados.”

O Ishida, pragmático desde o título, lembra da importância de se profissionalizar de verdade o trabalho em mídias sociais em todas suas esferas:

Não duvido nada que, daqui um tempo, algumas pessoas chegarão perguntando: alguém conhece uma ferramenta de graça que pegue esses dados do Facebook? E ainda por cima vão xingar o Facebook por ter limitado os dados desse jeito. Se você quer dados legais, bem agregados, organizados, não só no Facebook, mas em todas as outras redes, você tem que pagar por uma ferramenta. Social media não é de graça, como ainda muita gente pensa. Há um trabalho sério por trás de tudo.

Antes de ir para as dicas técnicas, gostaria de lembrar da importância de se pensar a atuação neste mercado não só em termos da receita que você vai ganhar hoje com uma plataforma específica. Mas também em termos de saúde da internet como um todo. O modelo de negócio do Facebook , ao contrário de empresas como Google e Twitter, não se baseia na livre circulação de informações na internet, mas sim na construção de barreiras para que tudo fique dentro do Facebook. Não é à toa que Tim Berners-Lee, um dos inventores da web, alertou sobre o perigo que o Facebook traz aos princípios da internet.

eartquakeAno passado, nos 10 anos do Facebook, escrevi como o Facebook se tornou um “ponto obrigatório de passagem“, um nível de centralização de poder muito perigoso. Para comparar, recomendo o texto, também de minha autoria “250 milhões de motivos para defender o Twitter“. Para uma visão mais ligada à pesquisa acadêmica, leia o excelente texto “The redistribution of methods: on intervention in digital social research, broadly conceived” da Noortje Marres. De 2012, discute como a abundância de dados sociais hoje traz novas oportunidades e desafios para a construção de conhecimento, especialmente para a pesquisa acadêmica. Um dos motivos é a centralização destes dados em corporações como Facebook e Google. Três anos depois, o Facebook piorou bastante a situação para todos.

Então vamos falar de como se preparar para o novo modelo de monitoramento no Facebook. Em primeiro lugar, uma pequena revisão de como vai funcionar. Como falamos acima, o Facebook não entregará os dados brutos para nenhuma ferramenta. Nem sequer para a Datasift, fornecedora de dados (que ferramentas como o BrandCare contratam). A Datasift vai ser a intermediária para aplicação das regras nos dados, através de sistemas como Biblioteca de ClassifiersModelos Baseados em RegrasMachine Learning Models. Abaixo um esqueminha utlizado pela Datasift em suas apresentações:

datasift - topic data - classifiers

Um detalhe importante de mencionar é que este processamento de dados não acontecerá nem sequer nos servidores da Datasift. Mas dentro dos servidores do Facebook. E, ao contrário do Twitter, não oferecerão a possibilidade de coleta de dados retroativos (por exemplo, no BrandCare podemos coletar tweets desde 2006).

O problema (e oportunidade) destas três lógicas é que a análise de sentimento ou classificação automatizada são, como todos sabem, algo muito complexo. E consideravelmente imprecisa. Abaixo temos um exemplo de configuração na interface da Datasift. Em bom português, uma das linhas significa que textos sobre estas marcas automotivas sendo monitoradas que contenham as palavras “recall, fault, broke down ou broken” serão marcadas com o código de Feature(Característica/Aspecto) chamado Reliability (Confiabilidade).

datasift presentation- rules

Em ferramentas de monitoramento como o BrandCare, transformamos o estabelecimento de regras para uma forma bem simples como na tela abaixo. Ou seja, para o usuário final o estabelecimento de regras simples como estas é algo bem fácil como na tela abaixo. No exemplo, esta série de palavras como “barato” e “caro” são ligadas a um atributo: neste caso o aspecto “Preço”.

brandcare - dashboard e commerce - regras

Isto significa que quanto às regras, parte das práticas que serão feitas com a mudança de dados no Facebook já são realizadas em alguns projetos de monitoramento. No caso acima, esta e diversas outras regras são transformadas em gráficos com indicadores sobre as marcas monitoradas. Exemplificando, uma série de regras e parâmetros customizados são enviados para o Facebook e ele retorna dados que serão transformados pelas ferramentas em gráficos. É como acontece quando se usa regras normalmente. No exemplo abaixo, uma série de regras vira gráfico de Temáticas, Sentimento, Palavras Negativas etc.

da regra ao dado

Mas há um grande ponto que, na minha opinião, é um dos mais problemáticos nesta mudança. Quem trabalha bem com regras de processamento de texto/linguagem natural, melhora continuamente as informações ao conferir, em amostras dos textos, se tais regras resultaram em aplicações adequadas de códigos, tags e sentimento. Mas isto não será possível mais com o Facebook. Você não poderá conferir nos próprios dados se aquelas 200 regras adicionadas que processam 4000 keywords para gerar 40 tags diferentes estão 100% precisas. Para fazer isto, será preciso recorrer a uma compreensão ampla das dinâmicas de conversação, além de trabalhar com modelagem e testes utilizando outros parâmetros textuais para se aplicar aos textos do Facebook.

Neste momento, monitoramento e pesquisa digitais que englobem o Facebook se aproximam ainda mais da pesquisa acadêmica e de áreas que envolvam a compreensão profunda das estruturas linguísticas e discursivas, além da organização da informação. Áreas como linguística de corpus, sociolinguística, text analytics, computação social, NL (processamento natural da linguagem) tornam-se mais importantes. Como o Facebook vai deixar parte do trabalho “às cegas”, é importante ter o máximo de domínio destas técnicas em grande escala (big data) para que os dados sejam o mais precisos possíveis e as estratégias e táticas resultantes deem resultado.

Para começar, recomendo revisitar as estratégias de criação de Categorias e Tags em projetos de monitoramento de mídias sociais. Em whitepaper que escrevi na Social Figures, descrevo três táticas básicas para gerar as categorias e tags: decompor o produto/serviço; responder demanda de informação do cliente; e descobrir informações emergentes nas mídias sociais.  A materialização destas táticas em listas de códigos/tags organizados é o primeiro passo para criação das regras e sistemas de processamento em seguida.

decompor responder descobrir

Quanto a linguística de corpus, o Tom McEnery é um dos principais estudiosos do tema na atualidade e lançou um curso online na FutureLearn chamado “Corpus linguistics: method, analysis, interpretation“. Compreender as mecânicas da língua e como tem sido estudadas ao longo das décadas pela linguística de corpus é um passo essencial para aplicar heurísticas e proxies de dados para descobrir informações. O McEnery também possui um livro básico sobre o tema chamado “Corpus Linguistics: Method, Theory and Practice“.

discourse and social mediaFocada em mídias sociais, a Michele Zappavigna estudou um corpus de 7 milhões de tweets totalizando 100 milhões de palavras. A pesquisadora australiana publicou um livro com os resultados, chamado “Discourse of Twitter and Social Media: How We Use Language to Create Affiliation on the Web”, que já resenhei aqui no blog. É útil neste momento especialmente por três motivos. O primeiro é para que todos lembrem o quanto o Twitter é maleável e amigável a pesquisas e geração de informações de todos os tipos. O segundo é que a classificação que a Zappavigna aplica em marcadores de Julgamento, Afeto e Apreciação são úteis para a criação de regras que tragam dados além somente de aspectos e sentimentos. Por fim, Twitter e Blogs servirão aos bons e cuidadosos profissionais que desejarem criar modelagens e testes das regras em textos reais e atuais antes de aplicar ao monitoramento também do Facebook. Tenho uma proposta de palestra no SMW sobre o tema (vote, se interessar a você).

Além das regras e dos classifiers já prontos, outra possibilidade será aplicar machine learning nos textos. Ainda não está perfeitamente claro como funcionará, mas isto não significa que se deve ficar de braços cruzados. A aplicação mais frequente de aprendizado de máquina em texto natural é a modelagem de tópicos. De modo bem geral, é uma técnica que identifica, em uma lista/corpus de textos, os tópicos a partir da frequência, ausência e diferença de palavras-chaves. Temos cerca de 20 anos de estudos nesta área, sendo hoje o modelo mais comum o LDA - Latent Dirichlet allocation.

IntroToLDA

topic modeling

Como é frequente em se tratando de pesquisa acadêmica, há ferramentas gratuitas que ajudam neste processo. Criada por David Newman e Arun Balagopalan, é uma materialização simples do LDA que, a partir de inputs em CSV/TXT permite identificar os “tópicos” em uma série de textos. Ferramentas do tipo, associadas ao conhecimento de monitoramento de mídias sociais, ajudam no processo de inferir termos que possam ser significativos a temas e tópicos no Facebook, mesmo estando parcialmente “às cegas”.

Outra fonte essencial de informação e aprendizado para os analistas neste momento é o projeto Tapor. O Text Analysis Portal for Research é uma iniciativa de professores de algumas das principais universidades do Canadá e reúne quase 500 ferramentas para text analysis. São inúmeras possibilidades de processar, explorar e visualizar dados a partir de text analytics. Grande parte destas visualizações não serão possíveis devido às novas restrições do Facebook. Mas em parte delas tente imaginar: como eu posso fazer sistemas de queries que me permitam trazer dados tão ricos?

tapor

Sempre importante lembrar que a limitação que o Facebook impôs está na busca. Ou seja, ainda é possível coletar dados de Facebook Pages, incluindo os comentários. O mesmo no caso dos Grupos. Abaixo, um exemplo de estudo de benchmarking baseado em tipos de conteúdo publicados por marcas do segmento de fast fashion:

facebook pages

O cruzamento da construção de corpora tanto de textos antigos do Facebook quanto de texto atual de outras mídias sociais, modelagem de tópicos e compreensão das estruturas linguísticas das conversas e opiniões será essencial para os analistas de dados. Mas tudo isto, claro, pode ser aplicado nas diversas mídias sociais e fontes de dados textuais. O que não pode continuar é o crescente fechamento da internet no Facebook. Sempre defendi a necessidade de criação de ambientes proprietários para as marcas ou organizações. Agora, mais do que nunca, isto se torna essencial.

Além disto, é importante lembrar que é possível extrair ainda mais dados dos outros canais como Twitter, Blogs, Instagram, Google+, Fóruns, Websites de modo geral, Google Trends, Wikipedia etc. Existem inúmeras metodologias e técnicas de geração de informações, provenientes da história das ciências sociais e computacionais, que podem ser aplicadas para gerar mais e mais insights. A Análise de Redes Sociais, por exemplo, era utilizada por uma pequena parcela de profissionais através de programas como NodeXL e Gephi. Ano passado, tive a oportunidade de integrá-la com o BrandCare, permitindo a escalabilidade destas aplicações para nossos clientes, com excelente resultado. E é um tipo de metodologia que é favorecida especialmente pela estrutura de dados e conversas no Twitter. 

nsmnss - completa

Parte da rede da hashtag #NSMNSS

Em resumo, não é o fim ou a crise do monitoramento para fins comerciais. As mudanças que o Facebook impôs vão impactar alguns tipos de projetos, mas não é o fim do mundo. Bons profissionais, agências, ferramentas e afins continuarão a realizar um bom trabalho. Mas, acima de tudo, que isto sirva de lição para lembrarmos que a internet é uma ferramenta poderosa demais para ser tomada por modelos de negócio centralizadores.


Convide uma mulher para palestrar!

Em outra postagem, apresentei um mapeamento de eventos que mostra a absurda discrepância entre números de homens e mulheres nos palcos de eventos sobre comunicação digital, mídias sociais e afins. Na maioria dos casos, as mulheres representam apenas 1/5 dos palestrantes! Há vários eventos, inclusive, que chegam ao absurdo de só terem palestrantes homens.

Mariana Oliveira, Nathalia Capistrano e Ana Paula Passarelli decidiram fazer algo contra esta incoerência e lançaram um projeto colaborativo de mapeamento de boas profissionais/palestrantes na área. O “Convide uma mulher para palestrar” oferece uma lista pública de profissionais com sua área de atuação, LinkedIn e descrição, além de receber sugestões. Confira e colabore:

convidemulher_post1


Mensuração: de 2010 a 2015, o principal entrave para as marcas nas mídias sociais

O gráfico abaixo, da histórica pesquisa “Mídias Sociais nas Empresas”, da Deloitte em 2010, esteve presente nas primeiras aulas e palestras que realizei. Cinco anos atrás, quando se falava bem menos sobre digital social analytics e mensuração de resultados em mídias sociais, era um gráfico necessário para se mostrar a importância destas capacidades para o profissional:
pesquisa deloitte
Ontem, no #FORRForum, da Forrester Research, o gráfico abaixo foi compartilhado. Trata-se da quantificação dos problemas e entraves mais frequentes para o marketing nas mídias sociais, em plataformas orgânicas. “Medir a performance destes perfis” lidera com muita folga frente a “Achar ou criar conteúdo para publicar” e “Decidir que tipo de conteúdo publicar”.

The Biggest Problem - Measurement

É particularmente alarmante esta percepção, pois os canais orgânicos são justamente os que oferecem mais dados para os gestores de marca e conteúdo. A importância de se divulgar análise rigorosa e procedimentos científicos, além de fomentar o debate na área, parece continuar tão relevante quanto cinco anos atrás.

O que sua agência, consultoria ou associação está fazendo para mudar esta situação?


Discurso no Twitter e Mídias Sociais: como usamos linguagem para criar afiliação na web

discourse and social media

O livro “Discourse of Twitter and Social Media: How We Use Language to Create Affiliation on the Web” foi lançado em 2012 pela professora Michelle Zappavigna, da University of South Wales (Austrália). A discussão e análise teórico-analítica se debruçou em um corpus, chamado de HERMES, criado pela pesquisadora com cerca de 7 milhões de tweets e de 100 milhões de palavras.

É um excelente exemplo da aplicação da linguística de corpus para a análise de mídias sociais, discurso, práticas interacionais, afetivas e políticas. Ao longo de seus capítulos, a autora aplica técnicas como análise de colocações, n-gram e contagem de frequências para identificar padrões e desvios nos textos do Twitter.

O primeiro capítulo, Social Media as Corpora, discute a possibilidade de entender as mídias sociais, e a sociedade através delas, a partir da construção de corpora de conteúdos textuais gerados em tempo real no Twitter. Parte do princípio de que as mídias sociais permitiram, sobretudo, a emergência da possibilidade de “discurso buscável” (searchable talk), com impactos relevantes na sociabilidade. Qualquer pessoa que já utilizou uma hashtag para marcar uma posição política ou para falar de um programa televiso, sabe muito bem do que a autora está falando:

“searchable talk, a change in social relations whereby we mark our discourse so that it can be found by others, in effect so that we can bond around particular values”

Zappavigna utiliza a SFL (systemic functional linguistics), que direciona a análise para uma abordagem funcional de análise utilizando metodologias de linguística de corpus. A partir da base antropológica, sobretudo de Malinowski, vê a linguagem como recurso para a realização de três funções: função ideacional de determinação de experiência, função interpesssoal de negociação de relações e função de textual de organização da informação.

Deste modo, no segundo capítulo, The Language of Microblogging, descreve as particularidades da linguagem no Twitter em suas manifestações fáticas, conversacionais ou como “backchannel” de outras atividades (vide segunda tela). Fatores da affordance do Twitter, como tamanho, hashtags e sua temporalidade própria são também analisadas. Neste capítulo a autora apresenta as primeiras aplicações de técnicas de linguística de corpus, como frequência de palavras:

hermes corpus - michele zappavigna

Evaluation in Microblogging, o terceiro capítulo, percorre o corpus HERMES a partir dos marcadores de sentimento/avaliação Julgamento, Afeto e Apreciação. Cada um dos “sistemas” de avaliação é explorado em detalhes, com inúmeros exemplos. Até o uso de emoticons é analisado de forma minuciosa, a partir da compreensão das emoções  expressas pelos usuários:

articulation network for facial emoticons

A criação de afiliação através dos textos é o tema do quarto capítulo, Ambient Affiliation. Através deste termo, a Michele Zappavigna procura mostrar como a plataforma é utilizada pelos seus usuários para gerar afiliações em torno de temas, tópicos e identidades. Aplicando o sociólogo Goffman, autor que melhor entendeu os processos micro-interacionais já na década de 1930 e hoje é aplicado em inúmeros estudos online, Zappavigna fala inclusive de como diversos estudos, inclusive o seu, mostram que técnicas de agrupamento (clustering) dão resultados consistentes apesar da aparente dispersão dos usuários. A liga social, neste caso, é a própria linguagem.

“we affiliate with a co-present, impermanente community by bonding around evolving topics of interest. This function is directly inscribed in the web interface to users’ Twitter accounts as the list of trending topics”

Nos três capítulos seguintes, Internet Memes, Internet Slang Internet Humour and fail: ‘The world is full of #fail tonight”, o livro analisa algumas particularidades das gírias, memes e humor no Twitter. Em sua maioria dos casos, são circulações meméticas que perpassam várias plataformas, como reddit e 4chan. Um trecho particularmente interessante é a análise da redefinição e complexificação do termo geek.

michele zappavigna collocates - geek out

Por fim, no nono capítulo, Political discourse online, a autora analisa um sub-corpus do Hermes chamado OWC – Obama Win Corpus. São 45290 publicados nas 24 horas subsequentes à vitória de Barack Obama nas eleições de 2008. O foco da análise se dá em torno da ideia de “mudança” (change), explorada pela campanha e militantes do político. É bem interessante também o relato que a autora faz dos tweets falando do cachorro presidencial, uma tradição no processo de construção da imagem dos presidentes americanos.michele zappavigna - collocates OWC - puppy

Por fim, nas conclusões a autora problematiza o futuro e limitações da linguística de corpus para as mídias sociais, especialmente relacionados à circulação de informação, inclusive textual, em formato de imagens.

+ Mais sobre Michele Zappavigna:

Twitter - https://twitter.com/smlinguist

Publicações - http://socialmedialinguist.blogspot.com.br/p/publications.html

Página na UNWS - https://sam.arts.unsw.edu.au/about-us/people/michele-zappavigna/

Google Scholar - https://scholar.google.com/citations?user=ILicbSEAAAAJ&hl=en