Camada analítica · NER e curadoria semântica

Entidades nomeadas nas
Community Notes em português

Esta página sintetiza o processo de reconhecimento de entidades nomeadas e mostra o que ele revela sobre o corpus: quais atores, fontes, lugares, instituições e pares de entidades organizam as notas em língua portuguesa.

O que esta camada acrescenta

Do texto livre para um mapa de atores, fontes e contextos

O NER transforma cada nota em um conjunto estruturado de menções: pessoas, atores políticos, veículos de mídia, órgãos públicos, URLs, locais, partidos, estatísticas, datas e outras categorias. Isso permite sair da leitura apenas textual e observar quem aparece, quais fontes sustentam as evidências e quais entidades circulam juntas.

A página não trata o reconhecimento automático como verdade final. O ponto central é a combinação entre extração por modelo, correferência e limpeza: “Lula”, “Luiz Inácio Lula da Silva” e variações passam a ser agregadas; descritores genéricos são removidos; e alguns casos dependentes de contexto recebem tratamento específico.

Leitura operacional

NERidentifica menções nomeadas no texto da nota e no contexto associado.
Coref.une aliases e variações de nomes em entidades canônicas.
Redemede entidades que aparecem juntas na mesma nota, por contagem absoluta.
Classecompara a composição das entidades entre notas úteis, não úteis e incertas.

Do GLiNER ao corpus curado

O notebook parte de df_entidades_gliner.parquet com 536.373 linhas de entidades, 131.399 notas únicas e 118.117 menções de pessoas. Depois da curadoria, a base usada nas análises fica menor e mais consistente.

Etapa 1

Extração inicial

O modelo reconhece spans de entidade e atribui tipos, mantendo metadados da nota, tema, status e contexto.

Etapa 2

Correlação de nomes

Aliases políticos e públicos são unificados em nomes canônicos para reduzir fragmentação.

Etapa 3

Limpeza de ruído

Descritores genéricos e termos institucionais pouco informativos são removidos antes dos agregados.

Etapa 4

Agregação analítica

As entidades limpas alimentam rankings, concentração, fontes, co-ocorrências e cruzamentos por classe.

Notas únicas
126.527
unidade de análise
Entidades extraídas
421.912
revisão canônica d4f438b3
Tipos de entidade
21
no esquema NER
Entidades por nota
3,3
média geral
Menções a pessoas
78.196
pol., pública ou genérica
Notas com URL
91,7%
evidência externa
Correção estrutural de agosto de 2026

Uma auditoria da camada de entidades encontrou dois defeitos sistemáticos na revisão anterior e removeu 88.440 das suas 510.352 linhas. O maior: 88.300 spans do modelo caíam dentro de um span URL_DOMINIO — o extrator lia o slug da URL como texto corrido, e globo, em g1.globo.com/…, era registrado uma segunda vez como veículo de mídia. Como o conteúdo da URL já é capturado pela camada determinística, essas menções duplicavam material já contado. Os outros 140 eram spans cujos offsets não recuperavam o próprio texto. A revisão canônica d4f438b3 tem 421.912 menções, e toda linha removida está publicada em quality_audit/entities_removed_2026-08.parquet.

Quais entidades estruturam o corpus

Na revisão canônica, URL_DOMINIO é o tipo mais frequente e responde por 41,4% das 421.912 menções distribuídas em 126.527 notas. Em seguida aparecem pessoas, locais, organizações e veículos de mídia. A distribuição descreve a composição do corpus neste snapshot; não mede a qualidade nem a suficiência da evidência citada.

Top tipos de entidade por volume de menções

Após correferência consolidada e remoção de genéricos
URL_DOMINIO
174.58241,4%
PESSOA
45.13510,7%
LOCAL
39.3689,3%
ORGANIZACAO
36.5428,7%
ATOR_POLITICO
32.0457,6%
ORGAO_PUBLICO
13.5483,2%
DATA
13.2873,1%
PLATAFORMA_DIGITAL
12.8353,0%
VEICULO_MIDIA
11.1702,6%
PARTIDO
8.6472,0%
ESTATISTICA
7.5141,8%
EVENTO_POLITICO
6.2621,5%
PROGRAMA_PUBLICO
5.1201,2%
VALOR_MONETARIO
4.1971,0%
ORGAO_SEGURANCA
3.8690,9%
ORGAO_JUDICIARIO
2.5350,6%
LEI_NORMA
1.7830,4%
OPERACAO_POLICIAL
1.0730,3%
PESSOA_PUBLICA
1.0160,2%
PROCESSO_JUDICIAL
7900,2%
FONTE_CITADA
5940,1%

Domínios são o tipo mais frequente

Pouco mais de um terço das menções são domínios de URL. O padrão é compatível com a função declarada das notas — acrescentar contexto verificável —, mas descreve a composição do corpus, não a qualidade da evidência citada.

Nomes, lugares e organizações vêm em bloco

Locais, pessoas e organizações aparecem logo em seguida. A observação descreve com que frequência esses tipos coocorrem no corpus, sem inferir o que sustenta cada checagem.

Política aparece, mas não domina isoladamente

Atores políticos formam uma categoria relevante sem ser a maior. O corpus mistura política, mídia, celebridades, plataformas e fontes oficiais.

Atores, pessoas públicas e concentração

A correferência revela uma forte concentração: poucos nomes organizam uma parcela relevante das menções. Entre atores políticos, Jair Bolsonaro e Lula aparecem muito acima dos demais, seguidos por Donald Trump e Alexandre de Moraes. Entre pessoas públicas, o topo mistura tecnologia, cultura pop, casos virais e celebridades.

Atores políticos mais mencionados

menções · notas únicas no detalhe · formas canônicas não fundidas entre si
lula
4.8714.166 notas
bolsonaro
4.3203.777 notas
trump
1.4111.227 notas
jair bolsonaro
1.1661.147 notas
alexandre de moraes
686659 notas
donald trump
522509 notas
presidente lula
478468 notas
nikolas ferreira
459448 notas
dilma
376342 notas
eduardo bolsonaro
325313 notas
nikolas
289260 notas
maduro
274243 notas

Pessoas mais mencionadas

tipo PESSOA · menções · notas únicas no detalhe · formas canônicas da revisão d4f438b3
jessica
879874 notas
taylor swift
797764 notas
o autor
725724 notas
elon musk
675638 notas
anitta
367333 notas
ana paula
354312 notas
neymar
337287 notas
jesus
324261 notas
milena
314276 notas
beyonce
310278 notas
a autora
214211 notas
lady gaga
208200 notas

Regra 80/20: quantas entidades explicam a maior parte das menções?

Quanto menor a porcentagem, maior a concentração do debate
ATOR POLITICO
270 entidades
concentram 80% das menções entre 3.576 formas canônicas · 7,6%
ORGAO PUBLICO
171 entidades
concentram 80% das menções entre 1.775 formas canônicas · 9,6%
VEICULO MIDIA
437 entidades
concentram 80% das menções entre 2.213 formas canônicas · 19,7%
PROGRAMA PUBLICO
441 entidades
concentram 80% das menções entre 1.448 formas canônicas · 30,5%
PARTIDO
81 entidades
concentram 80% das menções entre 964 formas canônicas · 8,4%

Domínios e fontes de evidência

O conjunto de URLs mostra duas camadas diferentes. Em volume absoluto de domínios, x.com aparece como o domínio mais citado, seguido por g1.globo.com, cnnbrasil.com.br, twitter.com e instagram.com. Já na leitura por categorias heurísticas nomeadas, a maior fatia classificada é a de mídia tradicional brasileira, seguida por redes sociais.

Top domínios citados

Contagem absoluta de URLs encontradas nas notas
x.com
16.745rede social
g1.globo.com
8.886midia tradicional br
cnnbrasil.com.br
5.798midia tradicional br
twitter.com
4.323rede social
instagram.com
3.361rede social
oglobo.globo.com
3.286midia tradicional br
pt.wikipedia.org
2.900wikipedia
poder360.com.br
2.826midia tradicional br
metropoles.com
2.702midia tradicional br
youtube.com
2.687rede social
noticias.uol.com.br
2.659midia tradicional br
help.x.com
2.630rede social
bbc.com
2.504midia internacional
youtu.be
2.472rede social

Categorias nomeadas de fonte

Participação real no total de 174.582 URLs; “outros” é o residual da heurística de classificação do notebook
outros
66.781 38,2% do total · residual
mídia tradicional br
48.402 27,7% do total
rede social
36.843 21,1% do total
governo oficial
9.341 5,3% do total
wikipedia
6.697 3,8% do total
mídia internacional
4.951 2,8% do total
fact checker
998 0,6% do total
acadêmico
611 0,3% do total
Leitura metodológica

As barras de categoria usam percentual real do total de URLs, não escala normalizada pelo maior grupo. A categoria outros foi mantida porque aparece na categorização heurística do notebook, mas deve ser lida como residual operacional: domínios que não foram enquadrados nas regras nomeadas, e não um tipo substantivo de fonte equivalente a mídia, governo, rede social ou fact-checking.

Co-ocorrência: quem aparece junto de quem

Para a rede, o notebook considera entidades presentes em pelo menos 5 notas, resultando em 5.537 entidades válidas e 63.587 pares distintos. A escolha por contagem absoluta favorece uma leitura direta: os pares abaixo são os que mais aparecem juntos na mesma nota.

Top pares co-citados

Contagem de notas em comum
bolsonaro + lula
605
choquei + jessica
577
stake + x
533
israel + hamas
356
brasil + eua
353
bolsonaro + brasil
296
lula + brasil
280
lula + PT
209
lula + STF
197
brasil + STF
196
gaza + israel
174
bolsonaro + STF
173

Heatmap de co-ocorrência entre atores políticos

Top 15 formas canônicas do tipo ATOR_POLITICO na revisão d4f438b3…a825d2. As formas não são fundidas entre si: lula e presidente lula, ou bolsonaro e jair bolsonaro, contam como entradas distintas. A fragmentação residual é um limite conhecido da camada automática de correferência.
Top 15 atores políticos — a diagonal mostra o total de notas com cada ator; as demais células mostram notas em comum entre pares
diagonal = total por ator fora da diagonal = co-ocorrência valores absolutos extraídos da matriz da seção 8.3
lulabolsonarotrumpjair
bolsonaro
alexandre
de
moraes
donald
trump
presidente
lula
nikolas
ferreira
dilmaeduardo
bolsonaro
nikolasmaduroflavio
bolsonaro
flavio
dino
moraes
lula 4.184 605 123 67 30 17 14 15 98 13 19 39 6 16 13
bolsonaro 605 3.803 115 16 34 11 19 8 71 5 3 5 6 5 55
trump 123 115 1.233 17 8 8 4 6 0 13 0 13 5 0 7
jair bolsonaro 67 16 17 1.147 19 35 7 4 8 26 0 0 31 3 0
alexandre de moraes 30 34 8 19 659 4 1 1 1 12 0 0 5 9 0
donald trump 17 11 8 35 4 510 2 0 0 14 0 1 4 0 1
presidente lula 14 19 4 7 1 2 468 6 0 0 0 1 3 2 0
nikolas ferreira 15 8 6 4 1 0 6 448 0 3 1 0 3 2 3
dilma 98 71 0 8 1 0 0 0 343 0 0 0 0 1 2
eduardo bolsonaro 13 5 13 26 12 14 0 3 0 313 0 1 4 0 1
nikolas 19 3 0 0 0 0 0 1 0 0 260 0 0 0 0
maduro 39 5 13 0 0 1 1 0 0 1 0 243 0 0 0
flavio bolsonaro 6 6 5 31 5 4 3 3 0 4 0 0 225 0 0
flavio dino 16 5 0 3 9 0 2 2 1 0 0 0 0 200 2
moraes 13 55 7 0 0 1 0 3 2 1 0 0 0 2 195
Maior presença individual: a forma canônica lula aparece em 4.184 notas na diagonal.
Par mais frequente: bolsonaro e lula aparecem juntos em 605 notas.

Vizinhos frequentes de lula

notas que citam lula, presidente lula ou lula da silva; mesmas exclusões
bolsonaro
625
brasil
307
PT
225
STF
207
trump
129
dilma
98
israel
87
jair bolsonaro
77
INSS
71
PL
62
eleicoes
55
PF
51

Vizinhos frequentes de bolsonaro

notas que citam bolsonaro ou jair bolsonaro; classes formais (URL, data, valor, estatística, lei, processo) excluídas
lula
666
brasil
374
STF
231
PF
223
trump
131
PT
126
PL
123
dilma
78
temer
75
INSS
63
bolsonarista
57
exercito
56
Como interpretar a rede

A co-ocorrência não prova relação causal nem concordância política. Ela mostra proximidade discursiva dentro das notas. Por isso, pares como Jair Bolsonaro ↔ Lula, Brasil ↔ g1 ou Hamas ↔ Israel devem ser lidos como sinais de temas recorrentes, não como juízos de valor.

Entidades e classe da nota

O cruzamento por label_3classes sugere uma diferença de composição. Notas classificadas como helpful têm proporção maior de URLs; notas not_helpful e uncertain concentram relativamente mais atores políticos e pessoas. Isso é coerente com a hipótese de que notas úteis tendem a ser mais ancoradas em evidência externa, enquanto notas incertas ou rejeitadas podem circular mais em disputa interpretativa sobre personagens e instituições.

Tipos selecionados por classe

% do tipo dentro de cada classe
TipoHelpfulNot helpfulUncertain
URL DOMINIO37,8%30,7%33,7%
ATOR POLITICO2,9%6,2%7,1%
PESSOA11,5%12,7%9,1%
ORGANIZACAO10,8%12,6%8,8%
VEICULO MIDIA8,3%7,8%8,6%
LOCAL9,2%9,7%9,7%
PLATAFORMA DIGITAL8,4%4,9%5,0%
ORGAO PUBLICO1,6%2,3%3,5%
PARTIDO0,6%1,9%1,9%

Atores políticos: predominância de incerteza

% das menções do ator em notas incertas
Jair Bolsonaro95%
Lula94%
Donald Trump88%
Alexandre de Moraes93%
Nikolas Ferreira95%
Dilma Rousseff94%
Nicolás Maduro87%
Javier Milei92%
Eduardo Bolsonaro97%
Flávio Dino95%
Cuidado metodológico

Esse cruzamento é descritivo, não causal. A presença de uma entidade não torna uma nota útil ou não útil; ela apenas ajuda a caracterizar o tipo de conteúdo, fonte ou disputa que aparece com maior frequência em cada classe.

Leitura final

1. O corpus é muito evidencial

URLs e veículos de mídia aparecem no centro da estrutura. A análise de entidades mostra que boa parte das notas tenta se legitimar por referência externa.

2. A política organiza o debate

Lula, Jair Bolsonaro, STF, PF, PT e PL formam uma rede recorrente, mas aparecem misturados a mídia, país, redes sociais e casos específicos.

3. A curadoria é indispensável

Sem aliases e remoção de genéricos, os rankings ficam fragmentados e superestimam ruído. A camada de correferência é parte do resultado, não só uma etapa técnica.

Esta página foi construída a partir dos resultados já materializados no notebook de análise. Para atualizar os números, basta reexecutar o pipeline de NER/curadoria, regenerar os agregados e substituir os blocos numéricos correspondentes.