Virtualize o patrimônio de dados Cloudera/Hadoop no Fabric OneLake com o Apache Ozone

by | 28/03/2025 | Fabric | 0 comments

Reading time: 5 minutes

A integração entre plataformas de dados locais e soluções em nuvem tem se tornado cada vez mais essencial para as empresas que buscam otimizar suas operações e escalar suas capacidades analíticas. Neste contexto, a virtualização do patrimônio de dados do Cloudera/Hadoop no Microsoft Fabric OneLake, utilizando o Apache Ozone, surge como uma solução poderosa. Com a utilização de atalhos OneLake, é possível acessar dados armazenados em ambientes locais e objetos de nuvem sem a necessidade de movimentação ou duplicação, garantindo mais agilidade e eficiência na gestão de dados. Este artigo explora como essa integração pode beneficiar as organizações ao estender seu patrimônio de dados do Hadoop para a nuvem, aproveitando os recursos da computação em nuvem sob demanda.

Atalho do OneLake

Os atalhos do Microsoft Fabric OneLake facilitam a virtualização de dados de vários armazenamentos de objetos de nuvem e ambientes locais. Para fontes locais como Cloudera/Apache Ozone, o atalho compatível com OneLake S3 pode ser utilizado para se conectar a essas fontes de dados. Com os atalhos do OneLake, os usuários podem criar uma referência virtual para seus dados de cluster do Cloudera sem mover ou duplicar os dados. Para saber mais sobre os atalhos do Fabric OneLake, consulte este blog OneLake com atalhos.

Ozônio Apache

O Apache Ozone é um armazenamento de objetos escalável e de código aberto projetado para análise, oferecendo compatibilidade com a API do S3. Ele está disponível nos tempos de execução do Cloudera CDP, permitindo a criação de um atalho compatível com o OneLake S3 para o cluster do Hadoop local. Para obter mais informações, consulte a documentação da Cloudera Introdução ao ozônio.

Lakehouse e plataformas de dados abertos

Tanto o Microsoft Fabric quanto o Cloudera CDP adotaram a arquitetura Lakehouse e aproveitam o formato de dados abertos Apache Iceberg. Além disso, o Microsoft Fabric oferece suporte nativo para o formato aberto do Delta Lake. Esta discussão examinará métodos para integrar essas duas plataformas.

Benefícios e Business Case

Os clientes da Cloudera agora têm a capacidade de estender seu patrimônio de dados do Hadoop local para a nuvem sem exigir movimentação de dados. Esse atalho do OneLake para o Apache Ozone facilita a migração perfeita para a nuvem ou permite que você expanda seus produtos Gold Data para a nuvem, aproveitando assim os recursos de computação em nuvem OnDemand.

Introdução ao Microsoft Fabric e Cloudera/Apache Ozone Clusters

O restante do artigo mostrará a integração em ação.

Pré-requisitos do Apache Ozone/Cloudera

  • Configure o sistema de arquivos Apache Ozone em seu cluster Cloudera.
  • Configure o Ozone S3 Gateway e exponha volumes não padrão ao volume /s3v/ padrão. Observe também o URL do endpoint do gateway para mais tarde.
  • Com a CLI do Ozone, crie o ID da chave de acesso da AWS e as credenciais da chave secreta da AWS para o Microsoft Fabric Shortcut. Guarde essas informações para mais tarde.
  • Migre os dados do HDFS para o ozônio. De preferência, tabelas Iceberg ou Delta com seus respectivos subdiretórios de dados e metadados e vinculá-los ao volume /s3v/ padrão do Ozone S3.
  • Valide se os dados estão disponíveis no volume /s3v/ padrão do S3 para atalho de malha.

Nesse caso, o comando mostra a tabela DIM_Geographies que foi copiada para o volume padrão do S3 dentro do bucket de ozônio icebergdata. Os diretórios de dados e metadados dessa tabela estão acessíveis, o que é essencial para nossa tabela de atalhos do Fabric OneLake.

Pré-requisitos do Azure

Ao adotar atalhos OneLake para integrar o Apache Ozone com o Microsoft Fabric, as empresas podem simplificar a gestão de seus dados, permitindo que suas soluções de Big Data no Cloudera/CDP migrem para a nuvem de forma eficiente, sem a necessidade de movimentação dos dados. Essa arquitetura baseada em Lakehouse, suportada tanto pelo Microsoft Fabric quanto pelo Cloudera, oferece uma estrutura robusta para análise de dados utilizando formatos abertos como Apache Iceberg e Delta Lake. A virtualização do patrimônio de dados, portanto, não só facilita a migração e a expansão para a nuvem, mas também contribui para a maximização do valor dos dados, ajudando as empresas a se beneficiarem de capacidades analíticas aprimoradas e recursos de computação escaláveis.

Source: Blog Microsoft Fabric.

Leve sua estratégia de dados para a nuvem sem complicações

A integração entre Cloudera/Hadoop e Microsoft Fabric por meio do Apache Ozone é o caminho ideal para escalar sua arquitetura de dados, mantendo o controle total do seu ambiente local. Com os atalhos do OneLake, você pode virtualizar seus dados sem movimentações, reduzindo custos operacionais, aumentando a eficiência e preparando sua empresa para o futuro da análise de dados em nuvem. Tudo isso com total compatibilidade com formatos abertos como Apache Iceberg e Delta Lake.

Na DataEX, somos especialistas em soluções de dados e IA e podemos ajudar sua empresa a implementar essa integração de forma segura, ágil e estratégica. Do planejamento à execução, entregamos uma jornada completa de transformação digital com base nas tecnologias mais inovadoras do mercado.

Agende agora uma conversa com nossos especialistas e descubra como modernizar seu ambiente de dados com o apoio da DataEX.

Preencha o formulário abaixo e nosso time de especialistas entrará em contato.

E nos siga em nossas social networks e leia o Blog Data Universe diariamente.

Ebook Data Driven Team - Cultura de Dados

Data Driven Team Ebook

Learn about the process that values and encourages the use of data in crucial decision-making in your business.

Privacy statement
Ebook Data Driven Team - Cultura de Dados

Data Driven Team Ebook

Learn about the process that values and encourages the use of data in crucial decision-making in your business.

See more related articles

Fabric + Databricks para múltiplas equipes: governança com liberdade operacional

Fabric e Databricks para múltiplas equipes ganham relevância quando a organização precisa...

Interoperabilidade entre Fabric, Redshift e Databricks sem retrabalho

A maioria das grandes empresas já não opera em uma única plataforma de dados. Parte da engenharia...

Azure + AWS + Lakehouse: plataformas híbridas em operação prática

O modelo azure aws lakehouse híbrido já faz parte da realidade de muitas empresas que operam entre...

Microsoft Fabric + Amazon S3: consolidação sem replicação desnecessária

A evolução das arquiteturas de dados tornou uma coisa evidente: poucas empresas operam hoje em um...

Fabric in a Day no Brasil: DataEX realiza o primeiro evento presencial do programa Microsoft e acelera a adoção de dados e IA

Um marco para o ecossistema de dados no Brasil A transformação orientada por dados deixou de ser...

Decisão orientada por dados: por que muitas empresas ainda erram mesmo com tecnologia 

Em 2026, falar em decisão orientada por dados já não é novidade, mas errar mesmo com tecnologia...