Post Job Free
Sign in

Cloud Data Engineer & Automation Specialist

Location:
Grapevine, TX
Posted:
July 22, 2026

Contact this candidate

Resume:

Rupesh Saw

*************@*****.*** 623-***-**** LinkedIn Github

CLOUD & AUTOMATION DATA PIPELINES DELIVERING ACTIONABLE INSIGHTS SKILLS

Database: MSSQL, MYSQL, Oracle, MongoDB, Postgres, Hive, Presto, Amazon Redshift

BI & Tools: Tableau, Power BI, Advanced Microsoft Excel Languages: Python, SQL, JavaScript, Scala, Bash/Shell Certifications:Databricks Certified DataEngineer

Professional, AWS Solutions Architect Associate,

Areas of expertise: Data Engineering & Analytics,

Cloud Architecture, ETL/ELT Development, Data

Governance, Business Intelligence, Data Modeling,

Automation & Orchestration, Visualization, SQL &

Python Development, Databricks, Agile & DevOps

Collaboration

PROFESSIONAL EXPERIENCE

Data Analyst Jan 2026 – Present

Vanguard Dallas, Texas

● Architected an AI-driven automation system using Python and LLMs to process large, multi-dimensional datasets, detecting schema discrepancies to ensure high accuracy in reporting for critical operational metrics.

● Directed statistical analysis and data quality initiatives across multiple sources, achieving 90%+ resolution of anomalies by partnering with business stakeholders to translate complex data needs into actionable insights and systematic workflows.

● Developed automated reporting solutions leveraging AI systems to ingest raw exports, transforming them into standardized insights that eliminate manual effort and support strategic decision-making for senior leadership.

● Engineered scalable data pipelines to load multi-dimensional data into Power BI, designing dashboards that enforce accountability and communicate results to senior leadership, directly impacting operational performance reviews.

● Managed cross-functional stakeholder alignment to define business requirements, creating knowledge bases that accelerated resolution times and optimized process flows for high-severity data incidents. Data Engineer June 2023 – Oct 2025

John Deere Dallas, Texas

● Deployed AI/ML solutions to architect and extend processing frameworks, reducing prototype time by ~30% and standardizing engineering patterns to support rapid development of new data products across teams.

● Led automation initiatives extracting metadata via Python to generate documentation, eliminating ~80% of manual effort and enhancing auditability, directly supporting operational best practices and compliance standards.

● Architected secure pipeline configurations and integrated validation tools to reduce configuration drift, enforcing governance and engineering excellence standards while ensuring compliance with security policies across multiple sources.

● Designed a data validation layer with structured logging to extract, transform, and clean large data sets, improving reliability and delivering actionable insights to stakeholders via automated alerts.

● Created dimensional data models and optimized datasets for self-service analytics, enhancing query performance and enforcing security controls to support evolving reporting requirements for business consumers.

● Architected incremental refresh patterns and right-sized imports to handle exponential data growth, cutting load times by

~25% and delivering scalable solutions that reduce processing latency for global teams.

● Built dashboards to monitor pipeline health, enabling faster root-cause analysis and ensuring enterprise-grade reliability for mission-critical data flows.

● Architected end-to-end data pipelines and centralized secrets management to strengthen access control, ensuring security and scalability while processing transactions across diverse upstream sources. Data Engineer May 2022 – May 2023

Vanguard Dallas, Texas

● Designed dimensional data models and curated analytics-ready datasets, tuning SQL to balance performance, data security, and governed self-service access for Finance and Analytics teams.

● Built Python/PySpark ETL on AWS Glue to consolidate jobs; orchestrated batch loads into Amazon Redshift, leveraging BigData technologies to improve reliability and support revenue data products.

● Migrated data from multiple sources into Redshift using Glue and Redshift Spectrum, leveraging AWS services to optimize storage layout, query performance, and cost efficiency for massive data volumes.

● Implemented incremental ingestion, CDC, and a data quality framework with CloudWatch alerts, ensuring accurate and timely insights that drive strategic decision-making and improve trust in analytics.

● Established data governance processes and standardized formats, collaborating with stakeholders to translate business requirements into technical solutions, cutting import errors by ~20% and improving manageability.

● Tuned Redshift warehouse performance via compression and concurrency settings, reducing scan costs and ensuring scalable processing of billions of records to meet query SLAs.

● Implemented CI/CD pipelines for SQL/Glue code, enforcing engineering excellence standards and controlled deployment workflows to support rapid expansion and innovative solutions.

● Partnered with business stakeholders to define KPIs and deliver governed dashboards, enabling faster and more compliant data-driven decisions that power strategic initiatives across the organization. EDUCATION

Masters of Science, Information Technology and Management, The University of Texas at Dallas Dallas, TX Bachelor of Engineering in Electronics, University of Mumbai Mumbai, IND



Contact this candidate