Análise de Texto com AntConc: Frequência e Lista de Palavras

Publicado em 13/07/2019 por Tarcízio Silva

No últim opost, aprendemos o básico sobre AntConc. Agora vamos te mostrar como usar AntConc para gerar listas e frequência de palavras, além do útil File Viewer (Visualizador de Arquivos).

Não esqueça que

Introdução e Configurações
Lista, Frequência de Palavras e Visualizador (estamos aqui)
Concordancer e Plotagem de ConcordÇancia (em breve)
Clusters e N-Grams (em breve)
Colocações (em breve)

As funções do AntConc são acessadas através das sete abas abaixo:

Neste tutoria, vamos seguir os passos para produzir listas de palavras.

Lembre de abrir seu arquivo e importar as configurações recomendadas para pesquisa em mídia social [tutorial].

Gerando e navegando em uma Lista de Palavras

Abra seu arquivo. Nos exemplos abaixo vou usar um dataset com 16 mil tweets em inglês contendo a palavra “brazil” (coletados através do Netlytic). Baixe o arquivo brazil_tweets_16732tweets_2017_11_30.txt em nossa pasta.

2. Na aba Word List,clique em Start e eespere alguns segundos:

3. Agora você pode explorar e navegar nos seus dados, descendo a barra de rolagem para encontrar palavras relevantes, organizar por Frequência (Frequency), Palavras (ordem alfabética) ou final da palavra (Word end).

4. Você pode buscar um termo específico na caixa de “Search Term” e clicar na busca “Search Only”:

5. Se você clicar em qualquer palavra, será direcionado para a aba Concordance. Em breve você poderá ler um tutorial aqui sobre a ferramenta.

6. Se clicar em qualquer palavra na ferramente de Concordance, será direcionado para a File View, onde poderá visualizar o termo/palavra. Funciona como um leitor simples de texto, onde você poderá ver o corpus/corpora completo.

7. Para exportar a lista, basta ir na aba Word List e clicar em File -> Save Output.

8. O resultado é um arquivo .txt similar a este:

9. Você pode abrir ou copiar-colar o resultado em um software de planilhas como Excel ou LibreOffice para outras análises:

Filtrando stopwords

Stopwords são palavras que você não quer contar ou visualizar. Geralmente, são as palavras mais comuns sem relevância semântica ou tópica para o seu problema de pesquisa (como artigos, pronomes e alguns advérbios).

Primeiro, você vai precisar de uma lista pronta de stopwords. Você pode produzir ou editar uma lista você mesmo, mas vamos começar com um exemplo simples. Você pode baixar uma lista de stopwords em inglês na nossa pasta de listas:

2. Para carregar uma lista de stopwords a partir de um arquivo .txt vá em Tool Preferences -> Word List. Lá você verá a opção“Use a stoplist below” na seção “Word List Range”. Clique em Open e selecione seu arquivo .txt :

Se você fez corretamente, as palavras aparecerão na caixa:

Agora é só clicar em “Apply”!

Volte para a aba Word List e clique no botão “Start”. Compare as duas listas abaixo. A primeira foi a lista original e a segunda é a lista com as stopwords filtradas:

Contando palavras específicas

Outra opção muito útil da Word List é contar apenas palavras específicas que você já conhecia ou descobriu como relevantes nos seus datasets/corpora. Siga os passos abaixo:

1. Primeiro, você precisa de uma lista de palavras. No nosso caso, vamos subir uma lista de palavras sobre times brasileiros. Baixe ela na pasta de listas.

2. Vá em Tool Preferences -> Word Lists e clique em “Add Words From File” para carregar o arquivo. Clique em “Use specific words below” e Apply:

3. Agora vá na aba Word List e clique ‘Start’ para gerar a lista novamente. O resultado vai ser uma lista apenas da palavras desejadas:

4. Exportar uma lista destas (através de File -> Save Output) permite que você use a contagem em outras ferramentas como a RAW Graphs para gerar visualizações como um Treemap:

É isto por agora! Espero que as funcionalidades acima te ajudem a explorar seus dados textuais extraídos de mídias sociais. O próximo tutorial vai focar no Concordancer e Concordance Plot (em breve)!

Análise de Texto com AntConc: introdução, arquivos e configurações

Publicado em 13/07/2019 por Tarcízio Silva

De modo geral, análise de texto computacional é um conjunto de técnicas para análise automatizada de conteúdo. Mesmo sem o uso de estatística complexa ou programação, pesquisadores das ciências sociais e humanidades podem otimizar suas técnicas de exploração de dados com técnicas como contagem de frequência, co-ocorrência e colocações.

AntConc é um dos softwares mais fáceis e úteis para análise textual e linguística de corpus. Foi desenvolvido por Laurence Anthony, Professor na Faculdade de Ciência e Engenharia da Waseda University, Japan. Ele desenvolve e oferece dúzias de ferramentas em seu website, como TagAnt e FireAnt.

Depois dessa introdução sobre AntConc, vamos cobrir suas principais funcionalidades nos posts a seguir:

Introdução, Abrindo Arquivos e Configurações (estamos aqui)
Lista e Frequência de Palavras
Concordancer e Concordance Plot (em breve)
Clusters e N-Grams (em breve)
Colocações(em breve)

A matriz a seguir foi proposta no artigo Computational text analysis for social science: Model assumptions and complexity e resume as possibilidades entre estatística/computação simples x complexa e entre especialização forte x fraca no domínio. Usar AntConc para analisar dados textuais de mídias sociais engloba tarefas estatísticas simples como contagem de palavras e n-grams, mas pode ser avançada para contagem de termos chave em dicionários criados por especialistas no tema/assunto.

Para entender e comparar abordagens de análise apoiada por computador, análise textual interpretativa apoiada por computador e linguística de corpus, recomendo o artigo Taming textual data: The contribution of corpus linguistics to computer-aided text analysis.

AntConc permite realizar as principais técnicas de linguística de corpus como frequência de palavras (word frequencies), colocações (collocation), concordância (concordance), n-grams e comparação de corpora a qualquer tipo de texto.

Mas vamos começar do início! Baixe a AntConc e leia o texto a seguir, que vai te ensinar o básico sobre as configurações e como abrir um arquivo.

Como coletar dados textuais em mídias sociais?

Há dúzias de ferramentas para pesquisa em mídias sociais que permitem extrair ou monitorar dados textuais nas principais plataformas. A maioria delas coleta dados através de keywords/hashtags e/ou de páginas e websites específicos. Geralmente as ferramentas usam codificação UTF-8 para exportar arquivos no formato .csv . Você pode abri-los no Excel ou Libreoffice e copiar-colar os textos para um bloco de notas e salvá-los como um arquivo .txt, um dos formatos preferenciais para o AntConc.

Lista de ferramentas/respositórios:

Se você nunca coletou dados textuais em mídias sociais, recomendo fortemente que comece pela excelente e super fácil de usar Netlytic e colete alguns tweets ou comentários do YouTube. Mas não se preocupe: vou lhe dar alguns datasets de exemplo nos próximos posts.

Formatos de arquivo

AntConc pode ler vários formatos diferentes: .txt, .xml, .html, .ant. O mais simples é o .txt, que você pode criar com um Bloco de Notas.

Formato	Descrição
.txt	.TXT é o formato mais simples para guardar arquivos. Softwares como Bloco de Notas, Notepad++, TextMate, Word dos editores de texto podem salvar seu arquivo neste formato.
.html	.HTML é o padrão para salvar páginas web. Você pode salvar uma pa´gina web e carregá-la direto no AntConc. AntConc tem algumas configurações que permite ignorar o texto entre os caracteres “<” e “>” usados em arquivos HTML.
.xml	.XML: Extensible Markup Language. É similar a um arquivo .HTML, mas usa tags customizadas para definir objetos e dados dentro de cada objeto. Na análise de texto ou linguística de corpus é usada para marcar cada palavra com suas categorias/classes em Etiquetamento de Texto (Part-of-Speech Tagging).
.ant	.ANT é um formato específico usado pela AntConc, intercambiável com .txt.

Codificação

É recomendável que você salve seus arquivos de texto com a codificação UTF-8. Codificação de caracteres é uma padronização de como o software vai processar caracteres e símbolos. UTF-8 é definido pelo padrão Unicode, que engloba caracteres usados na maioria das línguas e scripts ocidentais. Graças a isto, muitas ferramentas de coleta de dados usam a codificação UTF-8 como padrão. Então lembra de salvar seus arquivos como UTF-8!

Configurações óptimas para Textos de Mídia Social

Arquivo pré-configurado

AntConc não foi desenvolvido apenas para dados de mídias sociais mas para todos os tipos de texto, especialmente literatura, linguagem natural e corpora nacionais. Então são necessários alguns ajustes nas configurações.

As especificação serão listadas abaixo, mas ao invés de seguir cada passo, você pode simplesmente importar um Arquivo de Configurações (Settings File) com as opções recomendadas que preparei para você. Baixe o arquivo antconc_settings_for_social_media.ant e, no AntConc, vá em File -> Import Settings from File…, selecione e abra o arquivo:

Pronto! Agora o AntConc pode ser mais útil para análise de mídias sociais. Depois disso você pode pular os passos abaixo, mas recomendo ao menos lê-los para entender:

2. Configurações Globais (Global Settings) – Token Definition

Nesta seção, vamos explicar as configurações recomendadas. Mas lembre: você não precisa seguir os passos abaixo se você carregou o arquivo de configurações customizadas que mostrei acima.

Primeiro, precisamos configurar as configurações de token. Um token é um elemento (palavra, caractere, pontuação, símbolo etc) considerado pelo software. Na opção de Token Definition dentro de “Global Settings” você pode definir quais caracteres/símbolos o AntConc vai considerar quando contar e processar seus dados.

As configurações padrão são as seguintes:

Mas, quando trabalhos como dados de mídia social, há alguns caracteres especiais usados por usuários das plataformas que representam práticas específicas de conversação e afiliação. Dois deles são bem importantes:

O símvolo ‘@’: para usuários do Twitter e outras plataformas, o símbolo é usado para marcar perfis. Então é importante incluir o símbolo ‘@’. Isto vai nos permitir, por exemplo, contar os usuários mais comuns em um corpus ou o contrário: filtrar os usuários para focar nas palavras.

O símbolo ‘#’, por sua vez, é um tipo de marcados de metadados usados na maioria das plataformas para definir hashtags. Você pode adicionar o ‘#’ nas definições de token do AntConc para contar corretamente hashtags.

Recomendado:

Então, nós precismaos ir em Global Settings -> Token Definition, marcar a caixa “Append Following Definition” e incluir os símbolos ‘#’ and ‘@’.

3. Definições de ‘Caractere Coringa’

Um Caractere Coringa (“WildCard”) é um caractere que pode ser substituído por outro caractere, palavra ou símbolo durante uma busca. o AntConc tem vários corignas e podemos ver abaixo as configurações iniciais (Global Settings -> Wildcards).

O problema é que dois destes coringas são atribuídos a símbolos muito importantes nas mídias sociais, ‘@’ e ‘#’, como vimos anteriormente. Isto resulta que o AntConc “ignora” estes dois símbolos nos resultados, pois serão vistos como coringas.

Então recomendamos mudar estes dois coringas para outros símbolos. No exemplo abaixo, mudamos para ‘{‘ e ‘}’ .

Abrindo seu Arquivo ou Corpora

Abrindo seu(s) Arquivo(s)

Para abrir um arquivo ou conjunto de arquivos no AntConc, você só precisa ir em File -> Open File(s)… ou File -> Open Dir.

Através da opção File -> Open File(s) você pode selecionar um ou mais arquivos:

Se você abrir mais de um arquivo, o AntConc vai aplicar suas buscas e análise sem todos ao mesmo tempo:

Isto é muito útil para gerenciar datasets/corpora. Por exemplo: você pode analisar um ano de dados e salvar os textos (comentários, posts, tweets) de cada mês em um arquivo diferente. Ao abrir os 12 de um ano você conseguirá comparar coisas como: contagem de palavras específicas no Concordance Plot ou presença/permanência de clusters/n-grams.

Agora podemos falar sobre contagem de frequência de palavras. Te vejo no próximo post: Lista de Palavras, Frequência de Palavras e Visualização de Arquivos.

Mudanças no monitoramento de Facebook: prepare-se!

Publicado em 03/05/2015 por Tarcízio Silva

Neste primeiro de maio, ironicamente, o Facebook passou a “dificultar” o trabalho dos profissionais da querida área de monitoramento de mídias sociais. Nesta data passaram a valer as novas regras das APIs do Facebook. O principal impacto para o mercado de monitoramento de mídias sociais é que nenhuma ferramenta, nem usuário, poderá fazer coleta de dados brutos a partir de pesquisa de termos. Isto significa que não teremos mais acesso ao texto bruto ou ao perfil dos usuários (nem sequer nome e avatar!) de quem mencionar as marcas em suas timelines (fora de páginas e grupos). Somente será possível coletar alguns indicadores e quantificações já processadas, como: número de menções a marcas; número de menções a termos; número de menções a atributos de um produto/serviço; distribuição demográfica de quem fala sobre cada termo buscado; circulação de links etc.

Ilustrando de forma muito simples abaixo: se antes tínhamos acesso a todo o texto, link e avatar do usuário (na esquerda), agora cada post virará “apenas” um número nos gráficos:

Os impactos negativos desta mudança são os mais óbvios e imediatos. Em primeiro lugar, as marcas que tentavam descobrir problemas específicos de consumidores individuais através do monitoramento de postagens públicas não poderão mais fazê-lo. Agências e consultorias de pesquisa que realizavam estudos qualitativos baseados no comportamento discursivo/expressivo de usuários não poderão mais fazer isto no Facebook (neste caso há algumas alternativas, mas de menor escala – e assunto pra outro post). Ações de engajamento que envolviam a participação ativa dos usuários em seus próprios perfis também minguarão, pois não será possível monitorar as menções para reportar resultados. Tudo isto traz impactos óbvios para os modelos de serviços e receita de agências e ferramentas.

Mas chorar pelo leite derramado não ajuda. Então vamos aproveitar o que for possível, dadas as condições. Segue uma lista de materiais comentados que pode ajudar muito neste momento de disrupção.

Pra começo de conversa, gostaria de indicar três textos de profissionais que admiro e trabalham com monitoramento há tanto (ou mais) tempo que eu: o Roberto Cassano publicou no Medium da Frog o post “A Era Negra do Monitoramento“, o Eduardo Vasques da TV1 o texto “A Crise do Monitoramento” e o Gabriel Ishida da dp6 com o texto “Sobre a API do Facebook e o seu Topic Data“. Apesar de achar os títulos dos dois primeiros textos prejudiciais, pois tem muita gente que não lê ou se informa com atenção e podem criar um clima apocalíptico, são observações e comentários essenciais. Como comenta o Cassano, ” é preciso desenvolver uma estratégia e uma metodologia, que use ferramentas para se alcançar os objetivos reconhecendo e explorando as enormes limitações e desafios impostos pelas novas plataformas e por uma maior maturidade do próprio consumidor, cada vez mais ciente da (correta) necessidade de preservar sua privacidade.” E, nas palavras do Vasques, é hora de: “Abrir novas frentes de interação e estimular ainda mais o diálogo para que os públicos se manifestem nesses ambientes aos quais as marcas têm acesso. Ou seja, é hora de se abrir para novos aprendizados.”

O Ishida, pragmático desde o título, lembra da importância de se profissionalizar de verdade o trabalho em mídias sociais em todas suas esferas:

Não duvido nada que, daqui um tempo, algumas pessoas chegarão perguntando: alguém conhece uma ferramenta de graça que pegue esses dados do Facebook? E ainda por cima vão xingar o Facebook por ter limitado os dados desse jeito. Se você quer dados legais, bem agregados, organizados, não só no Facebook, mas em todas as outras redes, você tem que pagar por uma ferramenta. Social media não é de graça, como ainda muita gente pensa. Há um trabalho sério por trás de tudo.

Antes de ir para as dicas técnicas, gostaria de lembrar da importância de se pensar a atuação neste mercado não só em termos da receita que você vai ganhar hoje com uma plataforma específica. Mas também em termos de saúde da internet como um todo. O modelo de negócio do Facebook , ao contrário de empresas como Google e Twitter, não se baseia na livre circulação de informações na internet, mas sim na construção de barreiras para que tudo fique dentro do Facebook. Não é à toa que Tim Berners-Lee, um dos inventores da web, alertou sobre o perigo que o Facebook traz aos princípios da internet.

Ano passado, nos 10 anos do Facebook, escrevi como o Facebook se tornou um “ponto obrigatório de passagem“, um nível de centralização de poder muito perigoso. Para comparar, recomendo o texto, também de minha autoria “250 milhões de motivos para defender o Twitter“. Para uma visão mais ligada à pesquisa acadêmica, leia o excelente texto “The redistribution of methods: on intervention in digital social research, broadly conceived” da Noortje Marres. De 2012, discute como a abundância de dados sociais hoje traz novas oportunidades e desafios para a construção de conhecimento, especialmente para a pesquisa acadêmica. Um dos motivos é a centralização destes dados em corporações como Facebook e Google. Três anos depois, o Facebook piorou bastante a situação para todos.

Então vamos falar de como se preparar para o novo modelo de monitoramento no Facebook. Em primeiro lugar, uma pequena revisão de como vai funcionar. Como falamos acima, o Facebook não entregará os dados brutos para nenhuma ferramenta. Nem sequer para a Datasift, fornecedora de dados (que ferramentas como o BrandCare contratam). A Datasift vai ser a intermediária para aplicação das regras nos dados, através de sistemas como Biblioteca de Classifiers, Modelos Baseados em Regras e Machine Learning Models. Abaixo um esqueminha utlizado pela Datasift em suas apresentações:

Um detalhe importante de mencionar é que este processamento de dados não acontecerá nem sequer nos servidores da Datasift. Mas dentro dos servidores do Facebook. E, ao contrário do Twitter, não oferecerão a possibilidade de coleta de dados retroativos (por exemplo, no BrandCare podemos coletar tweets desde 2006).

O problema (e oportunidade) destas três lógicas é que a análise de sentimento ou classificação automatizada são, como todos sabem, algo muito complexo. E consideravelmente imprecisa. Abaixo temos um exemplo de configuração na interface da Datasift. Em bom português, uma das linhas significa que textos sobre estas marcas automotivas sendo monitoradas que contenham as palavras “recall, fault, broke down ou broken” serão marcadas com o código de Feature(Característica/Aspecto) chamado Reliability (Confiabilidade).

Em ferramentas de monitoramento como o BrandCare, transformamos o estabelecimento de regras para uma forma bem simples como na tela abaixo. Ou seja, para o usuário final o estabelecimento de regras simples como estas é algo bem fácil como na tela abaixo. No exemplo, esta série de palavras como “barato” e “caro” são ligadas a um atributo: neste caso o aspecto “Preço”.

Isto significa que quanto às regras, parte das práticas que serão feitas com a mudança de dados no Facebook já são realizadas em alguns projetos de monitoramento. No caso acima, esta e diversas outras regras são transformadas em gráficos com indicadores sobre as marcas monitoradas. Exemplificando, uma série de regras e parâmetros customizados são enviados para o Facebook e ele retorna dados que serão transformados pelas ferramentas em gráficos. É como acontece quando se usa regras normalmente. No exemplo abaixo, uma série de regras vira gráfico de Temáticas, Sentimento, Palavras Negativas etc.

Mas há um grande ponto que, na minha opinião, é um dos mais problemáticos nesta mudança. Quem trabalha bem com regras de processamento de texto/linguagem natural, melhora continuamente as informações ao conferir, em amostras dos textos, se tais regras resultaram em aplicações adequadas de códigos, tags e sentimento. Mas isto não será possível mais com o Facebook. Você não poderá conferir nos próprios dados se aquelas 200 regras adicionadas que processam 4000 keywords para gerar 40 tags diferentes estão 100% precisas. Para fazer isto, será preciso recorrer a uma compreensão ampla das dinâmicas de conversação, além de trabalhar com modelagem e testes utilizando outros parâmetros textuais para se aplicar aos textos do Facebook.

Neste momento, monitoramento e pesquisa digitais que englobem o Facebook se aproximam ainda mais da pesquisa acadêmica e de áreas que envolvam a compreensão profunda das estruturas linguísticas e discursivas, além da organização da informação. Áreas como linguística de corpus, sociolinguística, text analytics, computação social, NL (processamento natural da linguagem) tornam-se mais importantes. Como o Facebook vai deixar parte do trabalho “às cegas”, é importante ter o máximo de domínio destas técnicas em grande escala (big data) para que os dados sejam o mais precisos possíveis e as estratégias e táticas resultantes deem resultado.

Para começar, recomendo revisitar as estratégias de criação de Categorias e Tags em projetos de monitoramento de mídias sociais. Em whitepaper que escrevi na Social Figures, descrevo três táticas básicas para gerar as categorias e tags: decompor o produto/serviço; responder demanda de informação do cliente; e descobrir informações emergentes nas mídias sociais. A materialização destas táticas em listas de códigos/tags organizados é o primeiro passo para criação das regras e sistemas de processamento em seguida.

Quanto a linguística de corpus, o Tom McEnery é um dos principais estudiosos do tema na atualidade e lançou um curso online na FutureLearn chamado “Corpus linguistics: method, analysis, interpretation“. Compreender as mecânicas da língua e como tem sido estudadas ao longo das décadas pela linguística de corpus é um passo essencial para aplicar heurísticas e proxies de dados para descobrir informações. O McEnery também possui um livro básico sobre o tema chamado “Corpus Linguistics: Method, Theory and Practice“.

Focada em mídias sociais, a Michele Zappavigna estudou um corpus de 7 milhões de tweets totalizando 100 milhões de palavras. A pesquisadora australiana publicou um livro com os resultados, chamado “Discourse of Twitter and Social Media: How We Use Language to Create Affiliation on the Web”, que já resenhei aqui no blog. É útil neste momento especialmente por três motivos. O primeiro é para que todos lembrem o quanto o Twitter é maleável e amigável a pesquisas e geração de informações de todos os tipos. O segundo é que a classificação que a Zappavigna aplica em marcadores de Julgamento, Afeto e Apreciação são úteis para a criação de regras que tragam dados além somente de aspectos e sentimentos. Por fim, Twitter e Blogs servirão aos bons e cuidadosos profissionais que desejarem criar modelagens e testes das regras em textos reais e atuais antes de aplicar ao monitoramento também do Facebook. Tenho uma proposta de palestra no SMW sobre o tema (vote, se interessar a você).

Além das regras e dos classifiers já prontos, outra possibilidade será aplicar machine learning nos textos. Ainda não está perfeitamente claro como funcionará, mas isto não significa que se deve ficar de braços cruzados. A aplicação mais frequente de aprendizado de máquina em texto natural é a modelagem de tópicos. De modo bem geral, é uma técnica que identifica, em uma lista/corpus de textos, os tópicos a partir da frequência, ausência e diferença de palavras-chaves. Temos cerca de 20 anos de estudos nesta área, sendo hoje o modelo mais comum o LDA – Latent Dirichlet allocation.

Como é frequente em se tratando de pesquisa acadêmica, há ferramentas gratuitas que ajudam neste processo. Criada por David Newman e Arun Balagopalan, é uma materialização simples do LDA que, a partir de inputs em CSV/TXT permite identificar os “tópicos” em uma série de textos. Ferramentas do tipo, associadas ao conhecimento de monitoramento de mídias sociais, ajudam no processo de inferir termos que possam ser significativos a temas e tópicos no Facebook, mesmo estando parcialmente “às cegas”.

Outra fonte essencial de informação e aprendizado para os analistas neste momento é o projeto Tapor. O Text Analysis Portal for Research é uma iniciativa de professores de algumas das principais universidades do Canadá e reúne quase 500 ferramentas para text analysis. São inúmeras possibilidades de processar, explorar e visualizar dados a partir de text analytics. Grande parte destas visualizações não serão possíveis devido às novas restrições do Facebook. Mas em parte delas tente imaginar: como eu posso fazer sistemas de queries que me permitam trazer dados tão ricos?

Sempre importante lembrar que a limitação que o Facebook impôs está na busca. Ou seja, ainda é possível coletar dados de Facebook Pages, incluindo os comentários. O mesmo no caso dos Grupos. Abaixo, um exemplo de estudo de benchmarking baseado em tipos de conteúdo publicados por marcas do segmento de fast fashion:

O cruzamento da construção de corpora tanto de textos antigos do Facebook quanto de texto atual de outras mídias sociais, modelagem de tópicos e compreensão das estruturas linguísticas das conversas e opiniões será essencial para os analistas de dados. Mas tudo isto, claro, pode ser aplicado nas diversas mídias sociais e fontes de dados textuais. O que não pode continuar é o crescente fechamento da internet no Facebook. Sempre defendi a necessidade de criação de ambientes proprietários para as marcas ou organizações. Agora, mais do que nunca, isto se torna essencial.

Além disto, é importante lembrar que é possível extrair ainda mais dados dos outros canais como Twitter, Blogs, Instagram, Google+, Fóruns, Websites de modo geral, Google Trends, Wikipedia etc. Existem inúmeras metodologias e técnicas de geração de informações, provenientes da história das ciências sociais e computacionais, que podem ser aplicadas para gerar mais e mais insights. A Análise de Redes Sociais, por exemplo, era utilizada por uma pequena parcela de profissionais através de programas como NodeXL e Gephi. Ano passado, tive a oportunidade de integrá-la com o BrandCare, permitindo a escalabilidade destas aplicações para nossos clientes, com excelente resultado. E é um tipo de metodologia que é favorecida especialmente pela estrutura de dados e conversas no Twitter.

Parte da rede da hashtag #NSMNSS

Em resumo, não é o fim ou a crise do monitoramento para fins comerciais. As mudanças que o Facebook impôs vão impactar alguns tipos de projetos, mas não é o fim do mundo. Bons profissionais, agências, ferramentas e afins continuarão a realizar um bom trabalho. Mas, acima de tudo, que isto sirva de lição para lembrarmos que a internet é uma ferramenta poderosa demais para ser tomada por modelos de negócio centralizadores.

Discurso no Twitter e Mídias Sociais: como usamos linguagem para criar afiliação na web

Publicado em 06/04/2015 por Tarcízio Silva

O livro “Discourse of Twitter and Social Media: How We Use Language to Create Affiliation on the Web” foi lançado em 2012 pela professora Michelle Zappavigna, da University of South Wales (Austrália). A discussão e análise teórico-analítica se debruçou em um corpus, chamado de HERMES, criado pela pesquisadora com cerca de 7 milhões de tweets e de 100 milhões de palavras.

É um excelente exemplo da aplicação da linguística de corpus para a análise de mídias sociais, discurso, práticas interacionais, afetivas e políticas. Ao longo de seus capítulos, a autora aplica técnicas como análise de colocações, n-gram e contagem de frequências para identificar padrões e desvios nos textos do Twitter.

O primeiro capítulo, Social Media as Corpora, discute a possibilidade de entender as mídias sociais, e a sociedade através delas, a partir da construção de corpora de conteúdos textuais gerados em tempo real no Twitter. Parte do princípio de que as mídias sociais permitiram, sobretudo, a emergência da possibilidade de “discurso buscável” (searchable talk), com impactos relevantes na sociabilidade. Qualquer pessoa que já utilizou uma hashtag para marcar uma posição política ou para falar de um programa televiso, sabe muito bem do que a autora está falando:

“searchable talk, a change in social relations whereby we mark our discourse so that it can be found by others, in effect so that we can bond around particular values”

Zappavigna utiliza a SFL (systemic functional linguistics), que direciona a análise para uma abordagem funcional de análise utilizando metodologias de linguística de corpus. A partir da base antropológica, sobretudo de Malinowski, vê a linguagem como recurso para a realização de três funções: função ideacional de determinação de experiência, função interpesssoal de negociação de relações e função de textual de organização da informação.

Deste modo, no segundo capítulo, The Language of Microblogging, descreve as particularidades da linguagem no Twitter em suas manifestações fáticas, conversacionais ou como “backchannel” de outras atividades (vide segunda tela). Fatores da affordance do Twitter, como tamanho, hashtags e sua temporalidade própria são também analisadas. Neste capítulo a autora apresenta as primeiras aplicações de técnicas de linguística de corpus, como frequência de palavras:

Evaluation in Microblogging, o terceiro capítulo, percorre o corpus HERMES a partir dos marcadores de sentimento/avaliação Julgamento, Afeto e Apreciação. Cada um dos “sistemas” de avaliação é explorado em detalhes, com inúmeros exemplos. Até o uso de emoticons é analisado de forma minuciosa, a partir da compreensão das emoções expressas pelos usuários:

A criação de afiliação através dos textos é o tema do quarto capítulo, Ambient Affiliation. Através deste termo, a Michele Zappavigna procura mostrar como a plataforma é utilizada pelos seus usuários para gerar afiliações em torno de temas, tópicos e identidades. Aplicando o sociólogo Goffman, autor que melhor entendeu os processos micro-interacionais já na década de 1930 e hoje é aplicado em inúmeros estudos online, Zappavigna fala inclusive de como diversos estudos, inclusive o seu, mostram que técnicas de agrupamento (clustering) dão resultados consistentes apesar da aparente dispersão dos usuários. A liga social, neste caso, é a própria linguagem.

“we affiliate with a co-present, impermanente community by bonding around evolving topics of interest. This function is directly inscribed in the web interface to users’ Twitter accounts as the list of trending topics”

Nos três capítulos seguintes, Internet Memes, Internet Slang e Internet Humour and fail: ‘The world is full of #fail tonight”, o livro analisa algumas particularidades das gírias, memes e humor no Twitter. Em sua maioria dos casos, são circulações meméticas que perpassam várias plataformas, como reddit e 4chan. Um trecho particularmente interessante é a análise da redefinição e complexificação do termo geek.

Por fim, no nono capítulo, Political discourse online, a autora analisa um sub-corpus do Hermes chamado OWC – Obama Win Corpus. São 45290 publicados nas 24 horas subsequentes à vitória de Barack Obama nas eleições de 2008. O foco da análise se dá em torno da ideia de “mudança” (change), explorada pela campanha e militantes do político. É bem interessante também o relato que a autora faz dos tweets falando do cachorro presidencial, uma tradição no processo de construção da imagem dos presidentes americanos.

Por fim, nas conclusões a autora problematiza o futuro e limitações da linguística de corpus para as mídias sociais, especialmente relacionados à circulação de informação, inclusive textual, em formato de imagens.

+ Mais sobre Michele Zappavigna:

Twitter – https://twitter.com/smlinguist

Publicações – http://socialmedialinguist.blogspot.com.br/p/publications.html

Página na UNWS – https://sam.arts.unsw.edu.au/about-us/people/michele-zappavigna/

Google Scholar – https://scholar.google.com/citations?user=ILicbSEAAAAJ&hl=en

Tarcízio Silva

Pesquisa, ciência, tecnologia e sociedade, racismo algorítmico

Arquivo da tag: linguística de corpus

Análise de Texto com AntConc: Frequência e Lista de Palavras

Análise de Texto com AntConc: introdução, arquivos e configurações

Mudanças no monitoramento de Facebook: prepare-se!

Discurso no Twitter e Mídias Sociais: como usamos linguagem para criar afiliação na web