Post Job Free
Sign in

Cloud-Native Lead Data Engineer

Location:
Upper Marlboro, MD
Posted:
October 06, 2026

Contact this candidate

Resume:

Ashton M

Lead Data Engineer Cloud-Native Data Engineering Lakehouse Architect Real-Time Data

Engineering AI/ML Data Platforms

******.*.****@*****.*** 817-***-**** Murphy, TX, 75094, USA Professional Summary

Senior Lead Data Engineer with 9+ years of experience designing cloud-native data platforms, modern lakehouse architectures, and enterprise-scale analytics solutions across AWS, Azure, and GCP. Expertise in building scalable batch and real-time data pipelines using Spark, Kafka, Apache Flink, dbt, Airflow, Delta Lake, Databricks, and Snowflake to support analytics, AI/ML, and business-critical decision-making. Proven experience delivering secure, high-performance data platforms across healthcare, financial services, and enterprise environments, including EHR/EMR, HL7, and FHIR data. Skilled in cloud modernization, data governance, performance optimization, and leading cross-functional engineering teams to build reliable, AI-ready data ecosystems that improve scalability, operational efficiency, and business outcomes. Technical Skills

Programming & Query Languages

Python (PySpark, Pandas, Polars), SQL, Scala, Java, YAML, Bash, REST APIs

Data Pipelines & Orchestration

Apache Airflow, dbt, Apache NiFi, AWS Glue, Azure

Data Factory, Dagster, Prefect

Cloud Data Services

AWS (S3, EMR, Redshift, Glue, Lambda, Athena,

Kinesis, EKS); GCP (BigQuery, Dataflow, Pub/Sub,

Dataproc, Composer, Vertex AI); Azure (Synapse, Data Factory, Databricks, ADLS, Event Hubs, AKS)

Lakehouse & Storage

Delta Lake, Apache Iceberg, Apache Hudi, Lakehouse Architecture, Unity Catalog, Data Lakes

DevOps & Infrastructure

Terraform, Terragrunt, AWS CDK, Docker, Kubernetes, Helm, ArgoCD, CI/CD (GitHub Actions, Jenkins, Tekton) Monitoring & Observability

Prometheus, Grafana, ELK/EFK Stack, Datadog,

OpenTelemetry, Amazon CloudWatch

Leadership & Collaboration

Technical Leadership, Team Mentoring, Architecture Design, Stakeholder Management, Cross-Functional

Collaboration, Agile/Scrum

Big Data & Distributed Systems

Apache Spark, Apache Flink, Apache Beam, Hadoop

(HDFS, MapReduce, Hive), Presto/Trino, Kafka, Kafka Streams, Kinesis

Cloud Platforms

Amazon Web Services (AWS), Google Cloud Platform

(GCP), Microsoft Azure

Data Warehousing & Databases

Snowflake, BigQuery, Redshift, Synapse, PostgreSQL, SQL Server, Oracle, Teradata, MongoDB, Cassandra,

Redis

Data Modeling & Architecture

Star Schema, Snowflake Schema, Data Vault,

Dimensional Modeling, Medallion Architecture

(Bronze/Silver/Gold), ETL vs ELT Optimization, Batch vs Streaming, Data Mesh & Data Fabric

Data Governance & Quality

Great Expectations, Collibra, Apache Atlas, Monte

Carlo; HIPAA compliance, Data Contracts, Lineage

BI & Analytics

Power BI, Tableau, Looker, Amazon QuickSight

Professional Experience

Lead Data Engineer, Lark Health (Contractor)

•Architected and led the development of a cloud-native lakehouse platform across AWS and Azure (Azure Databricks, Synapse, ADLS), aligning data strategy with business and clinical objectives.

•Designed and implemented a scalable Medallion (Bronze/Silver/Gold) lakehouse architecture, evaluating trade-offs across ETL vs. ELT and batch vs. streaming patterns to ensure optimized data processing and analytics. 03/2024 – Present

•Established enterprise-grade ingestion frameworks for HL7/FHIR and EHR datasets, reducing onboarding time for new data sources by 40% while improving data quality and consistency.

•Led implementation of data governance, lineage, and quality frameworks (Monte Carlo, Collibra), ensuring HIPAA-compliant, audit-ready data operations.

•Oversaw development of scalable ELT pipelines (dbt, Snowflake, Airflow) across AWS and Azure, improving maintainability and standardizing transformations.

•Mentored and managed a team of engineers, driving best practices in DataOps, CI/CD, observability, and fault-tolerant pipeline design.

•Optimized cloud data platforms through workload tuning, storage optimization, and infrastructure automation, reducing operational costs while improving platform performance and resource utilization.

•Led cross-functional engineering initiatives by mentoring developers, defining technical standards, and partnering with architects, product owners, and business stakeholders to deliver reliable, scalable, and business-aligned data solutions. Senior Data Engineer, CareRev

•Engineered high-throughput data pipelines (batch and streaming) supporting multi- terabyte healthcare datasets, ensuring reliable and timely data delivery across systems.

•Designed event-driven data architectures using Apache Kafka and Apache Flink, enabling near real-time processing for patient monitoring and operational workflows.

08/2020 – 02/2024

•Built scalable cloud-native data platforms on Snowflake and Azure Synapse, improving system performance, elasticity, and cost efficiency.

•Modeled enterprise data using Star, Snowflake, and Data Vault techniques, enabling flexible analytics and reducing downstream data rework.

•Enhanced platform performance through advanced optimization strategies including partition pruning, query tuning, and workload isolation.

•Led modernization of legacy data ecosystems, transitioning on-prem workloads to cloud-based architectures with minimal disruption.

•Established data quality and validation frameworks, proactively identifying anomalies and improving overall data trust and consistency. ETL & Data Warehouse Engineer, Trellissoft

•Developed and maintained scalable ETL pipelines using SSIS, Informatica, and Talend, integrating data from relational databases, APIs, and flat files into enterprise data warehouses.

•Designed and implemented dimensional data models (Star and Snowflake schemas) to support reporting, analytics, and BI requirements. 11/2017 – 07/2020

•Built and optimized batch data workflows using SQL and Python, ensuring high data quality, consistency, and timely processing of business-critical datasets.

•Improved data warehouse performance through indexing, partitioning, and query optimization, significantly reducing report execution time.

•Implemented data validation, error handling, and monitoring mechanisms within ETL processes, ensuring reliability and accuracy of data pipeline. Key Projects

Real-Time Healthcare Intelligence Platform, Lark Health Tech Stack: Kafka, Spark Structured Streaming, Databricks, Delta Lake, Snowflake, Azure Synapse, HL7/FHIR, Monte Carlo, Airflow

•Architected a HIPAA-compliant real-time and batch data platform integrating EMR/EHR, HL7/FHIR, and IoT health data, enabling scalable analytics and near real-time patient monitoring.

•Achieved 99.9% system uptime, 40% reduction in data latency, and 25% faster clinical insights through optimized streaming pipelines and lakehouse architecture. Enterprise Healthcare Data Warehouse Modernization, CareRev Tech Stack: Snowflake, Azure Synapse, Airflow, dbt, Kafka, Python, Collibra, Terraform

•Led modernization of legacy systems into a cloud-based data warehouse/lakehouse, implementing ELT pipelines with dbt and Airflow to support scalable analytics and reporting.

•Delivered 60% faster data processing, 35% improved dashboard performance, and 30% cost reduction while enabling governed self-service analytics.

Education

Bachelor of Science in Computer Science



Contact this candidate