Postagens

Mostrando postagens com o rótulo Contextualizações

ETL - IPCA e Commodity Boi Gordo (Arquitetura Medallion - Delta Lake)

Imagem
  Introdução: Este trabalho descreve o desenvolvimento e a implementação de um pipeline de Extração, Transformação e Carga (ETL) com finalidade analítica, destinado à ingestão, padronização e análise de dados econômicos relacionados ao Índice Nacional de Preços ao Consumidor Amplo (IPCA) e ao preço do Boi Gordo . A proposta tem como objetivos centrais assegurar a qualidade e a consistência dos dados , garantir a rastreabilidade das transformações aplicadas e viabilizar a extração de insights analíticos relevantes para a compreensão da dinâmica econômica analisada. A arquitetura da solução fundamenta-se no uso das tecnologias Python , Apache Spark (PySpark) e Delta Lake , adotando o paradigma da arquitetura Medallion , estruturada nas camadas Bronze, Silver e Gold . Essa organização permite o gerenciamento progressivo dos dados, desde a ingestão bruta até a consolidação analítica, promovendo controle de versionamento, preservação de histórico e evolução estruturada do pipeline...

Normalização de Dados na Área de Logística: Modelagem e Implementação de um Banco de Dados Relacional

Imagem
Apresentação introdutória: A normalização de dados, no contexto de banco de dados relacionais, é um processo fundamental para a organização eficiente das informações. Ela garante que os dados sejam armazenados de forma estruturada, eliminando redundâncias e assegurando a integridade das informações.(Mannino,2014). Esse processo contribui para a melhoria do desempenho e facilita a manipulação dos dados dentro de um sistema de gerenciamento de banco de dado ( SGBD ). Por meio da normalização, as tabelas são organizadas de acordo com um conjunto de regras chamadas formas normais, que ajudam a distribuir os dados em diferentes tabelas, mantendo o relacionamento entre elas e evitando problemas como  anomalias de inserção, exclusão e atualização. Dessa forma, a normalização permite que os banco de dados operem de maneira eficiente, oferecendo consistências e confiabilidade nas operações realizadas. (Ramahrishnan:Gehrke,2011) Na área de desenvolvimento de sistemas, o desempenho e a organi...

Projeto Prático de Engenharia de Dados com Python, SQL e GitHub

Imagem
  Introdução:        Este projeto apresenta uma aplicação prática de Engenharia de Dados em um cenário empresarial realista , utilizando Python, SQL, Git e GitHub , com base na arquitetura conceitual Medallion (Bronze, Silver e Gold) , amplamente adotada em pipelines modernos de dados. O contexto do projeto está inserido no domínio de geoprocessamento, GIS e sensoriamento remoto , áreas que lidam com grandes volumes de dados espaciais, metadados técnicos e necessidade de rastreabilidade, qualidade e governança da informação. Para isso, são utilizados dados realistas em formato CSV , representando produtos e serviços geoespaciais comuns em empresas de tecnologia, engenharia e análise territorial. A solução contempla todo o ciclo de um pipeline de dados: Ingestão de dados brutos (Bronze) Tratamento, padronização e validação (Silver) Modelagem analítica e consolidação para consumo (Gold)    Todo o desenvolvimento é realizado em um ambiente ...