Calculadora de Entropia

Calcule a entropia, o ganho de informação, a entropia condicional e a informação mútua a partir de contagens ou probabilidades.

Os resultados são calculados automaticamente à medida que você informa os dados.

Dados da distribuição

Use a tabela para informar os valores dos resultados. A normalização automática é compatível.

Fórmula e interpretação
EntropiaInforme probabilidades ou contagens.

▼ Veja explicações e dicas abaixo ▼

O que é entropia na teoria da informação?

Entropia é uma forma de medir a incerteza em um conjunto de resultados possíveis. Quando um resultado é quase certo, a incerteza é baixa. Quando vários resultados são igualmente prováveis, a incerteza é maior porque é mais difícil prever o próximo resultado.

Na teoria da informação, entropia costuma ser descrita como a quantidade média de informação, surpresa ou incerteza produzida por uma distribuição de probabilidade. Uma moeda equilibrada tem mais incerteza do que uma moeda que quase sempre cai com cara, e um dado honesto de seis faces tem mais incerteza do que uma moeda equilibrada porque há mais resultados igualmente prováveis.

Essa ideia é útil porque muitos problemas reais podem ser expressos como distribuições de probabilidade. Um modelo meteorológico pode atribuir probabilidades a dias ensolarados, chuvosos e nublados. Um conjunto de dados de classificação pode conter contagens para diferentes classes. Uma tabela conjunta pode mostrar com que frequência duas variáveis ocorrem juntas. A entropia fornece um único número que resume quão dispersos, misturados ou incertos são esses resultados.

A mesma fórmula de entropia também permite calcular medidas relacionadas:

  • Entropia da distribuição: incerteza em um conjunto de resultados.
  • Entropia condicional: incerteza que permanece sobre uma variável depois que outra é conhecida.
  • Informação mútua: informação compartilhada por duas variáveis.
  • Ganho de informação: redução da entropia depois de uma divisão da árvore de decisão.

Por que a entropia e o ganho de informação são importantes

A entropia é útil quando você precisa de mais do que uma simples contagem. Ela considera tanto o número de resultados possíveis quanto o equilíbrio entre suas probabilidades.

Por exemplo, dois conjuntos de dados podem ter o mesmo número de classes, mas níveis de incerteza muito diferentes:

  • Um conjunto de dados com contagens de classe \(50, 50\) é bastante misturado.
  • Um conjunto de dados com contagens de classe \(99, 1\) está muito mais próximo de ser certo.

Os dois conjuntos de dados têm duas classes, mas suas entropias são muito diferentes. Por isso, a entropia é comum em estatística, ciência de dados, aprendizado de máquina, compressão e teoria da informação.

Em árvores de decisão, a entropia ajuda a comparar divisões candidatas. Uma divisão útil envia os exemplos para grupos-filhos mais previsíveis do que o grupo-pai. O ganho de informação mede essa redução da incerteza. Uma divisão com maior ganho de informação costuma ser mais informativa para as classes-alvo, embora ainda precise ser avaliada no contexto da qualidade dos dados, do tamanho da amostra e da validação do modelo.


Termos importantes

  • Resultado: Um resultado, categoria, classe ou estado possível.
  • Distribuição de probabilidade: Uma lista de probabilidades para todos os resultados possíveis. As probabilidades devem somar \(1\).
  • Contagem ou peso: Um valor não negativo que pode ser convertido em probabilidade ao ser dividido pelo total.
  • Auto-informação: A surpresa de um resultado, frequentemente escrita como \(-\log_b(p)\).
  • Entropia: A auto-informação média de todos os resultados.
  • Base do logaritmo: A base \(b\) usada na fórmula da entropia. A base \(2\) produz bits; a base \(e\) produz nats.
  • Probabilidade conjunta: A probabilidade de dois resultados ocorrerem juntos, como um valor de linha e um valor de coluna em uma tabela de contingência.
  • Probabilidade marginal: A probabilidade de uma variável depois de somar os valores da outra variável em uma tabela conjunta.
  • Entropia condicional: A incerteza que resta em uma variável depois que outra variável é conhecida.
  • Informação mútua: A quantidade de redução da incerteza compartilhada entre duas variáveis.
  • Ganho de informação: A queda da entropia depois de dividir um conjunto de dados-pai em grupos-filhos.

Como a entropia funciona

Para uma distribuição de probabilidade discreta, a entropia é calculada multiplicando cada probabilidade pelo logaritmo dessa probabilidade, somando os termos e invertendo o sinal:

$$ H(X) = -\sum_i p(x_i)\log_b p(x_i) $$

Em que:

  • \(H(X)\) é a entropia da variável \(X\).
  • \(p(x_i)\) é a probabilidade do resultado \(i\).
  • \(b\) é a base do logaritmo.
  • A base \(2\) produz entropia em bits.
  • A base \(e\) produz entropia em nats.

O sinal negativo é usado porque as probabilidades estão entre \(0\) e \(1\), e seus logaritmos são negativos ou zero. O resultado é não negativo para uma distribuição discreta.

Um resultado com probabilidade zero contribui com \(0\) para a entropia. Matematicamente, isso decorre do comportamento-limite de \(p\log(p)\) quando \(p\) se aproxima de zero. Na prática, significa que um resultado que nunca ocorre não acrescenta incerteza.

A entropia é maior quando todos os resultados listados são igualmente prováveis. Para \(n\) resultados igualmente prováveis, a entropia máxima é:

$$ H_{\max} = \log_b n $$

A entropia é zero quando um resultado tem probabilidade \(1\) e todos os outros resultados têm probabilidade \(0\).


Como funcionam a entropia conjunta, a entropia condicional e a informação mútua

Quando duas variáveis são estudadas em conjunto, uma tabela conjunta pode ser convertida em uma distribuição de probabilidade conjunta. A probabilidade de cada célula é o valor da célula dividido pelo total de todas as células.

A entropia conjunta de \(X\) e \(Y\) é:

$$ H(X,Y) = -\sum_x \sum_y p(x,y)\log_b p(x,y) $$

Isso mede a incerteza da dupla de variáveis em conjunto.

A entropia condicional mede a incerteza que resta em uma variável depois que a outra é conhecida:

$$ H(Y \mid X) = H(X,Y) - H(X) $$

De forma semelhante:

$$ H(X \mid Y) = H(X,Y) - H(Y) $$

A informação mútua mede a informação compartilhada pelas duas variáveis. Uma forma comum é:

$$ I(X;Y) = H(X) + H(Y) - H(X,Y) $$

Outra forma equivalente é:

$$ I(X;Y) = \sum_x \sum_y p(x,y)\log_b\left(\frac{p(x,y)}{p(x)p(y)}\right) $$

Se \(X\) e \(Y\) forem independentes na tabela, conhecer uma não reduz a incerteza sobre a outra, portanto a informação mútua é \(0\). Valores maiores indicam informação compartilhada mais forte na distribuição, mas a informação mútua, por si só, não prova causalidade.


Como funciona o ganho de informação em árvores de decisão

Em uma árvore de decisão, uma divisão separa um conjunto-pai em grupos-filhos. A entropia pode medir o quanto os rótulos de classe estão misturados antes e depois da divisão.

O ganho de informação é a entropia do pai menos a média ponderada das entropias dos filhos:

$$ \text{Gain}(S,A) = H(S) - \sum_{v \in \text{Values}(A)} \frac{|S_v|}{|S|}H(S_v) $$

Where:

  • \(S\) é o conjunto de dados-pai ou a distribuição de classes do pai.
  • \(A\) é o atributo ou a divisão que está sendo avaliada.
  • \(v\) é um valor ou ramo da divisão.
  • \(S_v\) é o grupo-filho criado pelo ramo \(v\).
  • \(\frac{|S_v|}{|S|}\) é o peso do grupo-filho.
  • \(H(S_v)\) é a entropia desse grupo-filho.

Um ganho de informação alto significa que a divisão reduziu bastante a incerteza. Um ganho igual a zero significa que a entropia ponderada dos filhos é igual à entropia do pai, portanto a divisão não tornou a distribuição de classes mais previsível.

Algumas ferramentas também mostram uma razão de ganho. Nesta calculadora, a razão de ganho C4.5 exibida é o ganho de informação dividido pela informação da divisão (a entropia dos pesos relativos ao tamanho dos filhos). Se a informação da divisão for zero, a razão será mostrada como indisponível porque o denominador é zero.


Exemplos práticos de entropia

Exemplo 1: entropia da distribuição a partir de contagens

Suponha que três resultados tenham as contagens \(9\), \(5\) e \(4\). O total é:

$$ 9 + 5 + 4 = 18 $$

As probabilidades são:

$$ \frac{9}{18},\quad \frac{5}{18},\quad \frac{4}{18} $$

Usando a base \(2\), a entropia é:

$$ H(X) = -\left(\frac{9}{18}\log_2\frac{9}{18} + \frac{5}{18}\log_2\frac{5}{18} + \frac{4}{18}\log_2\frac{4}{18}\right) $$
$$ H(X) \approx 1.495538\ \text{bits} $$

A entropia máxima possível para três resultados é:

$$ \log_2 3 \approx 1.584963\ \text{bits} $$

Portanto, essa distribuição é bastante incerta, mas não perfeitamente equilibrada. O primeiro resultado é mais comum do que os outros dois, o que reduz a entropia ligeiramente abaixo do máximo.


Exemplo 2: informação mútua a partir de uma tabela conjunta

Considere esta tabela conjunta de contagens não negativas:

\(Y_1\) \(Y_2\) \(Y_3\)
\(X_1\) \(18\) \(2\) \(1\)
\(X_2\) \(4\) \(12\) \(3\)
\(X_3\) \(1\) \(5\) \(16\)

A contagem total é \(62\). Cada célula é dividida por \(62\) para formar uma tabela de probabilidades conjuntas. Em bits, essa tabela produz aproximadamente:

  • \(H(X) \approx 1.582313\)
  • \(H(Y) \approx 1.580146\)
  • \(H(X,Y) \approx 2.592217\)
  • \(H(Y \mid X) \approx 1.009904\)
  • \(H(X \mid Y) \approx 1.012071\)
  • \(I(X;Y) \approx 0.570242\)

A informação mútua não é zero, portanto as variáveis de linha e coluna compartilham informação nessa tabela. No entanto, ainda há incerteza condicional nos dois sentidos, então conhecer uma variável não determina completamente a outra.


Exemplo 3: ganho de informação de uma divisão

Suponha que um nó-pai tenha duas contagens de classe:

$$ [9, 5] $$

A entropia do pai é:

$$ H(S) \approx 0.940286\ \text{bits} $$

Agora suponha que uma divisão crie dois nós-filhos:

$$ [6,1]\quad \text{and}\quad [3,4] $$

Cada entropia de filho é ponderada pelo total do filho. A entropia ponderada dos filhos é aproximadamente:

$$ 0.788450\ \text{bits} $$

Portanto, o ganho de informação é:

$$ \text{Gain} \approx 0.940286 - 0.788450 = 0.151836\ \text{bits} $$

Essa divisão reduz a incerteza, mas apenas moderadamente. Uma divisão mais forte produziria nós-filhos mais próximos de serem puros, como um filho formado principalmente pela classe \(1\) e outro principalmente pela classe \(2\).


Exemplo 4: um caso extremo com probabilidade zero

Para a distribuição:

$$ [1, 0, 0] $$

A entropia é:

$$ H(X) = 0 $$

Não há incerteza porque o primeiro resultado é certo.

For the distribution:

$$ [0.5, 0.5, 0] $$

O resultado com probabilidade zero não contribui, e os dois resultados restantes são igualmente prováveis:

$$ H(X) = 1\ \text{bit} $$

Por isso, valores zero são aceitos desde que a probabilidade, a contagem ou o peso total seja positivo.


Como interpretar o resultado

O significado do resultado depende do modo selecionado.

No modo de entropia da distribuição, o resultado é a incerteza média dos resultados. Um resultado próximo de \(0\) significa que um resultado domina. Um resultado próximo de \(\log_b n\) significa que os resultados são quase igualmente prováveis. O “maior contribuidor” é o resultado com o maior termo \(-p\log_b(p)\). Ele nem sempre é simplesmente o resultado mais provável.

No modo de tabela conjunta, o resultado principal é a informação mútua \(I(X;Y)\). Um valor próximo de \(0\) significa que as variáveis de linha e coluna compartilham pouca informação na tabela. Um valor maior significa que conhecer uma variável reduz a incerteza sobre a outra. Os valores de entropia condicional mostram quanta incerteza permanece depois que uma variável é conhecida.

No modo de ganho de informação, o resultado principal mostra quanta entropia a divisão remove da distribuição de classes do pai. Um resultado positivo significa que, em média, os grupos-filhos são mais previsíveis do que o pai. A entropia ponderada dos filhos mostra quanta incerteza permanece depois da divisão.

Bits e nats usam escalas diferentes. A mesma distribuição tem um valor numérico maior em bits do que em nats porque a base do logaritmo é diferente:

$$ H_{\text{bits}} = \frac{H_{\text{nats}}}{\ln 2} $$

Ao comparar valores de entropia, certifique-se de que eles usem a mesma unidade.


Erros comuns e equívocos

  • Inserir contagens com a normalização desativada: Contagens como \(9, 5, 4\) não somam \(1\). Elas precisam ser normalizadas antes de serem tratadas como probabilidades.
  • Esquecer que as probabilidades devem somar um: Se você inserir probabilidades diretamente, elas devem somar \(1\) dentro da tolerância da calculadora.
  • Comparar bits e nats como se fossem idênticos: Eles medem o mesmo conceito em escalas logarítmicas diferentes.
  • Supor que a entropia mede significado: A entropia mede a incerteza nas probabilidades, não a importância ou o significado dos rótulos dos resultados no mundo real.
  • Tratar informação mútua como causalidade: A informação mútua pode revelar dependência em uma tabela, mas não prova que uma variável causa a outra.
  • Ler o gráfico sem verificar o modo: O gráfico mostra as contribuições de entropia no modo de distribuição, as probabilidades marginais das linhas no modo de tabela conjunta e as entropias dos filhos no modo de ganho de informação.
  • Usar contagens inconsistentes na árvore de decisão: A calculadora exige que os totais dos filhos sejam iguais ao total do pai, porque os pesos do ganho de informação descrevem uma partição dos dados do pai. Ela também rejeita uma linha de filho com total zero.
  • Arredondar cedo demais: Os cálculos de entropia usam logaritmos, portanto arredondar as probabilidades antes do cálculo pode alterar perceptivelmente o resultado.

Quando usar entropia, informação mútua e ganho de informação

Use a entropia quando quiser resumir a incerteza em uma distribuição de probabilidade, especialmente quando os resultados forem categóricos.

Use a informação mútua quando quiser medir o quanto duas variáveis discretas estão associadas por meio de uma tabela conjunta.

Use a entropia condicional quando quiser saber quanta incerteza permanece depois que outra variável é conhecida.

Use o ganho de informação quando estiver comparando divisões candidatas em um problema de classificação no estilo de árvore de decisão.

Essas medidas são especialmente úteis para:

  • aprender os fundamentos da teoria da informação;
  • analisar distribuições de probabilidade categóricas;
  • comparar a impureza das classes em conjuntos de dados de aprendizado de máquina;
  • avaliar divisões de árvores de decisão;
  • estudar a dependência entre duas variáveis em uma tabela de contingência;
  • entender como a incerteza muda depois que uma nova informação é conhecida.

Limitações e pontos importantes

Os cálculos de entropia só são tão significativos quanto a distribuição informada. Se as contagens, probabilidades, pesos ou valores da tabela estiverem incorretos, o resultado também estará incorreto.

Esta calculadora trabalha com valores finitos não negativos. Valores negativos, células numéricas vazias, valores não numéricos e totais iguais a zero não são válidos para esses cálculos.

No modo de distribuição, a configuração de normalização automática é importante. Com a normalização ativada, as contagens ou os pesos são divididos pelo total. Com a normalização desativada, os valores são tratados como probabilidades e devem somar \(1\) dentro da tolerância da calculadora.

No modo de tabela conjunta, os valores das células são normalizados internamente pelo total da tabela inteira. A variável de linha é tratada como \(X\), e a variável de coluna é tratada como \(Y\).

No modo de ganho de informação, a primeira linha é tratada como a distribuição de classes do pai, e as linhas abaixo dela são tratadas como nós-filhos da divisão. Cada filho deve ter um total positivo, e todos os totais dos filhos devem ser iguais ao total do pai dentro da tolerância numérica da calculadora. A calculadora pondera cada entropia de filho pelo total do filho dividido pelo total do pai.

Os valores exibidos são arredondados. O resultado principal é mostrado com até seis casas decimais, enquanto os cartões de resumo, as tabelas detalhadas e os rótulos do gráfico podem usar uma precisão diferente. Diferenças muito pequenas podem ser causadas pelo arredondamento, especialmente na informação mútua e no ganho de informação.

Entropia, informação mútua e ganho de informação descrevem propriedades matemáticas dos dados que você informa. Eles não substituem modelagem estatística, validação, conhecimento do domínio ou julgamento profissional quando os resultados afetam pesquisa, engenharia, finanças, saúde, segurança, obrigações legais ou decisões oficiais.


Como usar esta calculadora

  1. Escolha um modo: entropia da distribuição, métricas da tabela conjunta ou ganho de informação da árvore de decisão.
  2. Escolha a unidade de saída: bits para logaritmos de base 2 ou nats para unidades de logaritmo natural.
  3. No modo de distribuição, informe os rótulos dos resultados e contagens, pesos ou probabilidades não negativos. Ative a normalização automática ao informar contagens ou pesos.
  4. No modo de tabela conjunta, informe os nomes das linhas para \(X\), os nomes das colunas para \(Y\) e valores não negativos para a tabela.
  5. No modo de ganho de informação, informe as contagens de classe do pai na primeira linha e as contagens de classe dos nós-filhos nas linhas abaixo.
  6. Adicione resultados, linhas, colunas, divisões de filhos ou classes conforme necessário.
  7. Use a opção de importação se quiser colar dados compatíveis em vez de preencher a tabela manualmente. As tabelas numéricas conjunta e de ganho aceitam colunas delimitadas por vírgula, ponto e vírgula, tabulação ou espaços em branco; as linhas de distribuição usam um rótulo seguido por uma vírgula, ponto e vírgula ou tabulação e um valor.
  8. Revise o resultado principal, os cartões de resumo, a tabela detalhada, o cartão de fórmula, o cartão de interpretação e o gráfico.

Perguntas frequentes

O que significa um valor de entropia maior?

Um valor de entropia maior significa que a distribuição é mais incerta ou está mais uniformemente espalhada entre os resultados. O máximo depende do número de resultados e da base do logaritmo. Para \(n\) resultados igualmente prováveis, o máximo é \(\log_b n\).


Qual é a diferença entre bits e nats?

Bits usam o logaritmo de base \(2\). Nats usam o logaritmo natural, de base \(e\). Eles medem a mesma incerteza em escalas diferentes, portanto os valores só devem ser comparados diretamente quando usam a mesma unidade.


Posso informar contagens brutas em vez de probabilidades?

Sim, quando o modo da calculadora oferece suporte à normalização. No modo de distribuição, ative a normalização automática para contagens ou pesos. No modo de tabela conjunta, as contagens das células são normalizadas internamente pelo total da tabela.


Por que valores zero não causam um problema de logaritmo?

Um resultado com probabilidade zero contribui com \(0\) para a entropia. O cálculo usa apenas termos de probabilidade positivos para \(-p\log_b(p)\). No entanto, o total da distribuição ou da tabela ainda deve ser maior que zero.


Informação mútua é o mesmo que correlação?

Não. A correlação geralmente mede um tipo específico de relação, muitas vezes a associação linear entre variáveis numéricas. A informação mútua mede a informação compartilhada em distribuições de probabilidade e pode detectar formas mais amplas de dependência, mas não explica a causa da relação.


O que o ganho de informação indica em uma árvore de decisão?

O ganho de informação indica quanto uma divisão reduz a incerteza das classes em comparação com o nó-pai. Um ganho maior significa que os nós-filhos são, em média, mais informativos. Isso não garante que a divisão será bem generalizada para novos dados.


O que devo verificar antes de confiar em um resultado de ganho de informação?

Verifique se a linha do pai e as linhas dos filhos representam o mesmo problema de classificação, usam a mesma ordem de classes e contêm contagens finitas não negativas. Cada filho deve ter pelo menos uma observação, e os totais dos filhos devem corresponder ao total do pai porque a calculadora exige uma partição válida.


Fontes e referências

Livros e obras didáticas

  1. Aston Zhang, Zachary C. Lipton, Mu Li e Alexander J. Smola. Dive into Deep Learning. Capítulo 22.11, “Information Theory”. Acesso em 4 de julho de 2026. https://d2l.ai/chapter_appendix-mathematics-for-deep-learning/information-theory.html
  2. Mohammed J. Zaki e Wagner Meira Jr. Data Mining and Machine Learning: Fundamental Concepts and Algorithms. 2ª ed., Cambridge University Press, 2020. Capítulo 19, “Decision Tree Classifier”. https://dataminingbook.info/book_html/

Artigos fundamentais e fontes on-line

  1. Claude E. Shannon. “A Mathematical Theory of Communication”. The Bell System Technical Journal, vol. 27, p. 379–423 e 623–656, 1948. https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf
  2. J. Ross Quinlan. “Induction of Decision Trees”. Machine Learning, vol. 1, p. 81–106, 1986. https://hunch.net/~coms-4771/quinlan.pdf