
A Microsoft acaba de anunciar as Estatísticas de Tabela Automatizadas na Engenharia de Dados do Microsoft Fabric — uma grande atualização que ajuda você a obter um desempenho de consulta extremamente rápido sem esforço manual.
Esteja você executando junções complexas, grandes agregações ou cargas de trabalho de filtragem pesadas, as novas estatísticas automatizadas do Fabric ajudarão o Spark a tomar decisões mais inteligentes, economizando tempo, computação e dinheiro.
O que são estatísticas de tabela automatizadas?
Em termos simples, as estatísticas de tabela são métricas resumidas sobre seus dados que o Spark usa para otimizar consultas, que incluem:
- Total de contagens de linhas.
- Contagens nulas por coluna.
- Valores mínimos e máximos por coluna.
- Contagens de valores distintos por coluna.
- Comprimentos médios e máximos das colunas.
Até agora, a geração dessas estatísticas exigia a execução de comandos manuais () ou a configuração de pipelines personalizados. Com esta versão, o Fabric os coleta automaticamente quando você cria uma nova tabela Delta — sem necessidade de configuração ou ajuste.ANALYZE TABLE
Por que isso importa?
O Otimizador Baseado em Custo (CBO) do Spark depende de boas estatísticas para:
- Escolha a melhor estratégia de junção (por exemplo, junção de transmissão vs. junção aleatória).
- Remover partições de forma eficaz.
- Reduza embaralhamentos desnecessários de dados.
- Otimize as agregações.
Sem estatísticas precisas, o Spark só pode adivinhar, muitas vezes levando a planos de consulta lentos ou caros. Com estatísticas automatizadas, o Spark se torna muito mais inteligente e, em nossos benchmarks internos, vimos ganhos de desempenho de até ~45% em cargas de trabalho complexas.
How does it work?
- Habilitado por padrão em todas as novas tabelas Delta.
- Rastreia as primeiras 32 colunas (incluindo colunas aninhadas).
- Armazena estatísticas separadamente no formato Parquet para evitar arquivos de dados inchados.
- Totalmente integrado ao Fabric Spark 3.5 e posterior.
Você também pode ajustar o comportamento com configurações:
Ativar/desativar a coleta de estatísticas:

Ativar/desativar a injeção do otimizador:

Como verificar ou recalcular estatísticas
Quer ver o que está por baixo do capô? O Fabric permite inspecionar as estatísticas coletadas e recalculá-las, se necessário:
Verifique as estatísticas atuais (Scala):

Recalcular após alterações de esquema:

Para controle total, você também pode usar o comando familiar.ANALYZE TABLE
Limitações importantes a serem conhecidas
Como acontece com qualquer recurso avançado, é importante entender os limites atuais:
- As estatísticas são coletadas apenas no momento da gravação.
- Atualizações de outros mecanismos não serão incluídas.
- Apenas as primeiras 32 colunas são rastreadas.
- O recálculo de estatísticas pode exigir a reescrita da tabela.
- Sem fallback → em casos raros, as estatísticas às vezes podem afetar o desempenho.
Estamos trabalhando ativamente para expandir o suporte, incluindo melhorias para tabelas existentes e melhores fluxos de trabalho de recomputação.
Saiba Mais
Para saber mais sobre estatísticas automatizadas para tabelas, visite a documentação Configurar e gerenciar estatísticas de tabela automatizadas no Fabric Spark.
Source: Blog Microsoft Fabric.
Impulsione o desempenho com menos esforço: Conheça as estatísticas automatizadas do Microsoft Fabric
Esqueça os ajustes manuais e pipelines personalizados: agora, o Microsoft Fabric automatiza a coleta de estatísticas de tabela para entregar consultas até 45% mais rápidas em cargas de trabalho complexas. Com a nova funcionalidade ativada por padrão, seu time ganha tempo, economiza recursos e obtém respostas mais inteligentes do Spark sem complicação.
Descubra como essa atualização transforma a performance de grandes junções, agregações e filtros pesados. Um avanço essencial para quem quer elevar a eficiência das operações de dados sem abrir mão da simplicidade.
Preencha o formulário abaixo e nosso time de especialistas entrará em contato.
E não se esqueça de nos seguir em nossas social networks e ler o Blog Data Universe diariamente.
