Este repositório apresenta uma Prova de Conceito (PoC) para implementação de uma Plataforma de Dados utilizando a Dadosfera SaaS, aplicada a um cenário realista de e-commerce com aproximadamente 1,4 milhão de registros (Amazon Products Dataset 2023).
O objetivo é demonstrar como a Dadosfera pode atuar como camada central de integração, processamento, modelagem, IA e consumo analítico, reduzindo complexidade arquitetural e acelerando a geração de valor.
A empresa possui mais de 1 milhão de produtos cadastrados com:
- Estrutura de catálogo pouco padronizada
- Dificuldade de análise estratégica por categoria
- Baixa capacidade de segmentação inteligente
- Ausência de estrutura adequada para IA e recomendação
Impacto estimado:
- Perda de oportunidades de venda por baixa recomendação inteligente
- Dificuldade em identificar categorias estratégicas
- Alto custo operacional para análises ad-hoc
A solução proposta centraliza, estrutura e enriquece o catálogo utilizando engenharia de dados e GenAI.
Arquitetura de dados implementada no projeto:
RAW → Standardized → Enriched → Curated → Consumo Analítico
Descrição das camadas:
- RAW → dados brutos ingeridos via módulo de Coleta da Dadosfera
- Standardized → limpeza, padronização e criação de atributos derivados
- Enriched → enriquecimento semântico via LLM
- Curated → modelagem dimensional para análises analíticas
- Consumo Analítico → dashboards e Data App
app/ → Data App Streamlit
assets/ → Diagramas e imagens do case
dashboard/ → Queries SQL e prints do Metabase
data/ → Dados processados (amostras)
docs/ → Documentação complementar (PMBOK, modelagem, etc.)
notebooks/ → ETL, LLM e análises exploratórias
A documentação completa de cada etapa do case está disponível na pasta docs/, organizada conforme o template oficial da Dadosfera:
| Item | Descrição | Status | Documentação |
|---|---|---|---|
| 1 | Planejamento (PMBOK) | Concluído | Ver |
| 2 | Base de Dados | Concluído | Ver |
| 3 | Integrar e Explorar | Concluído | Ver |
| 4 | Data Quality | Concluído | Ver |
| 5 | GenAI / LLM | Concluído | Ver |
| 6 | Modelagem de Dados | Concluído | Ver |
| 7 | Dashboards | Concluído | Ver |
| 8 | Pipelines | Concluído | Ver |
| 9 | Data App | Concluído | Ver |
| 10 | Apresentação | Concluído | Ver |
- PostgreSQL (Cloud): Base transacional pública utilizada como origem operacional do e-commerce.
- Utilizado para simular ambiente transacional real e permitir integração via módulo de Coleta da Dadosfera.
- Python (Google Colab): Processamento e transformação dos dados.
- Pandas / PyArrow: Manipulação e persistência em formato analítico.
- Parquet: Armazenamento otimizado para análises.
- Estruturação em camadas: RAW → Standardized → Curated.
- Modelagem Dimensional (Kimball): Construção de Data Warehouse com visão analítica orientada a negócio.
- Separação em tabelas fato e dimensões para suportar análises por categoria e série temporal.
- OpenAI API (LLM): Extração de features estruturadas a partir de descrições textuais.
- Enriquecimento semântico do catálogo para segmentação e futuras aplicações de recomendação.
- Metabase (via Dadosfera): Dashboards internos na plataforma.
- Power BI: Análises complementares externas e comparação arquitetural.
- Dadosfera SaaS: Camada central de integração, catalogação, pipelines e governança.
- Streamlit: Aplicação interativa para exploração do catálogo enriquecido (Standardized + Enriched).
- Google Colab
- Visual Studio Code
- GitHub
- Python 3.10+
- Variável de ambiente OPENAI_API_KEY configurada
- Dataset com ~1.5M registros
- Baixar o dataset via Kaggle
- Executar o notebook
01_etl_ingestao_limpeza.ipynb - Executar o notebook
02_series_temporal_e_metricas.ipynb - Executar o notebook
03_processar_genai_llm_features.ipynb - Gerar o dataset utilizado pelo Data App
- Executar a aplicação Streamlit em
app/app.py
O vídeo apresenta:
- Problema de negócio
- Arquitetura proposta
- Demonstração da plataforma
- Viabilidade de substituição da arquitetura atual
Link do vídeo (Unlisted): Apresentação do Case
A solução demonstra como a Dadosfera pode substituir arquiteturas fragmentadas, centralizando ingestão, processamento, governança, inteligência artificial e consumo analítico em uma única plataforma.