DevOps & Platform Engineer | DevSecOps | SRE | AI Platform / LLMOps
Engenharia de plataformas, automação, confiabilidade e segurança para ambientes críticos — da infraestrutura e dos dados até a entrega de aplicações e serviços de IA.
Atuo na interseção entre DevOps, Platform Engineering, DevSecOps, SRE, infraestrutura híbrida, dados e desenvolvimento. Minha experiência envolve o ciclo completo de serviços e aplicações: arquitetura, provisionamento, configuração, CI/CD, observabilidade, segurança, resposta a incidentes, backup, recuperação e evolução contínua.
Trabalho com infraestrutura crítica e de alta disponibilidade, incluindo private cloud/IaaS baseada em VMware vSphere, plataformas Kubernetes/K3s e Docker Swarm, automação com Terraform/OpenTofu e Ansible e pipelines que conectam qualidade, segurança, entrega e rollback.
Também participo da implantação e evolução de uma plataforma interna de IA em servidores GPU, com foco em AI Platform/LLMOps, inferência de modelos, integração governada com sistemas, controle de acesso e observabilidade.
Meu objetivo é transformar operações complexas em plataformas reproduzíveis, seguras, observáveis e simples de operar.
Estou consolidando uma trilha prática de Platform Engineering com infraestrutura como código, automação de deploy, observabilidade e segurança desde o template até a operação. A ideia é manter exemplos públicos reproduzíveis, com validações automatizadas e documentação suficiente para servir tanto como referência técnica quanto como base de novos projetos.
| Frente | Atuação |
|---|---|
| Infraestrutura | Operação e evolução de private cloud com virtualização, redes, storage e serviços distribuídos |
| Ambientes | Padronização entre desenvolvimento, homologação, produção e treinamento |
| Entrega | Redução significativa do tempo de deploy por meio de pipelines automatizados e reutilizáveis |
| Confiabilidade | Healthchecks e rollback automático para a última imagem estável em caso de falha |
| Orquestração | Administração de clusters Docker Swarm e Kubernetes em múltiplos ambientes |
| Continuidade | Políticas de backup em storage, cópias offline e procedimentos documentados de restore |
| Automação | Redução de trabalho manual com scripts, APIs, webhooks, n8n e infraestrutura como código |
- Provisionamento declarativo em private cloud com VMware vSphere, OpenTofu/Terraform e cloud-init.
- Configuração e automação multiambiente com Ansible, Semaphore, Python e PowerShell.
- Gestão de capacidade, right-sizing, disponibilidade, padronização e otimização de custos/FinOps.
- Construção de plataformas e serviços compartilhados para aproximar desenvolvimento, infraestrutura, dados, segurança e operação.
- Fundamentos de AWS e aplicação prática de princípios cloud-native em infraestrutura privada e híbrida.
- Kubernetes, K3s, MetalLB, Traefik, Docker, Docker Compose, Docker Swarm e Portainer.
- Jenkins, Semaphore, GitHub Actions e GitLab CI/CD para build, validação, versionamento e deploy.
- Harbor, Nexus e SonarQube para artefatos, imagens, qualidade e controles no ciclo de entrega.
- Healthchecks, promoção entre ambientes, recuperação e rollback automático.
- Helm, Kustomize, Argo CD e policy-as-code aplicados nos templates públicos do portfólio.
- Métricas, logs e traces com Prometheus, Grafana, Loki, Tempo, OpenTelemetry e Grafana Alloy.
- Node Exporter, cAdvisor, Promtail, exporters especializados, dashboards e alertas.
- Troubleshooting, análise de causa raiz, runbooks, resposta a incidentes e continuidade operacional.
- Alta disponibilidade, failover, disaster recovery, capacidade e redução de trabalho operacional repetitivo.
- HashiCorp Vault, AppRole, Ansible Vault, Docker Secrets e gestão segura de credenciais.
- Keycloak, OAuth 2.0, OpenID Connect, RBAC e Kong API Gateway.
- TLS/mTLS, Step CA/PKI, hardening, segregação de ambientes e princípio do menor privilégio.
- Wazuh, Falco/Falcosidekick, análise estática, scan de imagens e validações automatizadas.
- Proteção de repositórios públicos contra exposição de secrets, states, planos, chaves e dados internos.
- PostgreSQL/Percona PostgreSQL em alta disponibilidade com Patroni, etcd, HAProxy e Keepalived/VRRP.
- PgBouncer, pgBackRest, WAL archiving, replicação, failover/switchover, backup e restore em S3.
- Apache Kafka em KRaft, Kafka Connect, Debezium CDC, Schema Registry, Avro e Apache Ranger.
- Processamento de streams com Apache Flink e observabilidade de brokers, conectores, tópicos e jobs.
- Apache Airflow, Apache Superset, Redis/Sentinel, MongoDB, MariaDB e integrações orientadas a dados.
- Ceph/Cephadm, OSDs, pools replicadas e erasure-coded e RADOS Gateway compatível com S3.
- Buckets, usuários, quotas, policies, versionamento, criptografia, Object Lock e retenção.
- MinIO, NFS, Veeam Backup & Replication e rotinas documentadas de recuperação.
- Integração de object storage com bancos, Airflow, aplicações e políticas de backup.
- Operação de workloads de IA em servidores GPU com Kubernetes/K3s e NVIDIA Container Runtime.
- Model serving com vLLM e gateway de modelos com LiteLLM.
- Open WebUI, balanceamento com MetalLB/Traefik, réplicas, healthchecks e integração por APIs.
- Métricas de GPU e host com DCGM Exporter, Node Exporter, Prometheus e Grafana.
- Controle de acesso, secrets, observabilidade e integração governada com sistemas e fontes de dados institucionais.
- Python, PowerShell, Bash, Node.js, TypeScript, React, Express, Prisma e SQL.
- APIs REST, webhooks, integrações, n8n, ChatOps e automação de processos.
- Testes automatizados, documentação técnica e desenvolvimento de ferramentas internas.
- Backstage, TechDocs, MkDocs, Markdown e catálogos de serviços.
| Projeto | O que demonstra |
|---|---|
| kubernetes-devops-template | Kubernetes com Helm, Kustomize, Argo CD, HPA, PDB, NetworkPolicy, policy-as-code, validação CI e smoke tests. |
| opentofu-vsphere-template | IaC para VMware vSphere com OpenTofu, backend remoto S3-compatible, TechDocs, release versionada, CI e guardrails de produção. |
| ansible-vsphere-template | Automação Ansible para vSphere com inventário multiambiente, Vault opcional, lint, Trivy, TechDocs, runbooks e proteção contra secrets. |
| ansible-observability-stack-template | Stack de observabilidade com Prometheus, Grafana, Loki, Tempo, OpenTelemetry Collector, Alertmanager e validações automatizadas. |
| request-forms-platform | Aplicação full stack containerizada com React, Express, Prisma, PostgreSQL, automação e documentação de publicação segura. |
Esses repositórios formam uma trilha técnica: provisionamento → configuração → CI/CD → segurança → Kubernetes → observabilidade → operação de aplicações.
Os projetos públicos utilizam exemplos sanitizados e redes reservadas para documentação. Informações, credenciais e topologias sensíveis de ambientes reais não são publicadas.
- Automatizar tarefas repetitivas e manter operações idempotentes e reproduzíveis.
- Tratar infraestrutura, configuração, políticas e documentação como código versionado.
- Integrar segurança e observabilidade desde o início do ciclo de entrega.
- Projetar para falhas com healthchecks, rollback, backup, restore e runbooks testáveis.
- Medir resultados técnicos em tempo de entrega, confiabilidade, capacidade e redução de trabalho manual.
- Compartilhar conhecimento sem expor dados sensíveis ou detalhes de ambientes institucionais.
- Cloud pública com foco em AWS, Kubernetes gerenciado, segurança e FinOps.
- Internal Developer Platforms, autosserviço e golden paths com Backstage e GitOps.
- Supply chain security, SBOM, assinatura de artefatos e policy-as-code.
- SRE orientado por SLI/SLO, error budgets, MTTR e redução de toil.
- LLMOps com avaliação, tracing, controle de custo/latência, RAG e segurança para aplicações de IA.
- LinkedIn: linkedin.com/in/darson-jocarbas-08b961123
- E-mail: dev.jocarbas@gmail.com
- Localização: Fortaleza, Ceará, Brasil



