Database Administrator
We are seeking a senior Iceberg DBA / Lakehouse Operations Engineer to own reliability, performance and operational integrity of the Apache Iceberg data layer that powers enterprise analytics and business-critical apps. You will operate in a large-scale, multi-engine Lakehouse environment (Spark, Hive, Impala) and support data modernization initiatives (Hive/Teradata → Iceberg). This role directly impacts downstream reporting and decision-making.Key responsibilities:- Day-to-day ownership of Iceberg tables: ensure availability, consistency and integrity for TB–PB datasets.- Advanced table maintenance: compaction (minor/major), small-file mitigation, snapshot expiration, metadata compaction, orphan file cleanup (vacuum).- Data layout optimization: file-size tuning, partition evolution/pruning, clustering/ordering strategies (e.g., Z-ordering patterns).- Enforce data modeling and Lakehouse design: 3NF where appropriate, medallion (Bronze/Silver/Gold) layers, alignment with ingestion patterns and downstream requirements.- Multi-engine query consistency and tuning across Spark (CDE), Hive/Impala (CDW); resolve metadata inconsistencies and inefficient plans.- Metadata and lifecycle management: retention/archival, snapshot lifecycle, time-travel optimization.- Production support: L2/L3 troubleshooting, on-call rotation, P1/P2 incident response, RCA and preventive action.- Security/governance: support Ranger/RBAC policies, data validation and reconciliation between source and Iceberg.Required skills: Apache Iceberg/Hive experience, Spark SQL/Hive/Impala/NiFi/Trino, partitioning, Parquet/ORC, distributed query processing. Preferred: migration experience (Hive→Iceberg, Teradata→Iceberg), Cloudera CDP, cloud (AWS/Azure), Python/Shell automation.