参与云端数据处理管线的开发、维护与优化工作,协助完成数据从采集、处理到训练全链路的工程化落地;
负责数据Pipeline相关模块的代码编写、单元测试与文档撰写,保障代码质量与可维护性;
协助排查数据流转过程中的异常与性能瓶颈,参与日志分析、问题定位与修复工作;
参与数据管线自动化工具与监控脚本的开发,提升数据运维效率。
硕士在读,计算机、软件工程、人工智能等相关专业,每周至少实习4天,实习期3个月以上;
扎实的Python编程基础,熟悉常用数据结构与设计模式,代码风格规范;
了解数据处理基础流程,有ETL/数据Pipeline开发经验者优先;
了解Docker、Kubernetes等容器化技术,有云端开发经验者优先;
具备良好的学习能力与团队协作精神,对数据工程领域有热情。
加分项
了解Airflow、DolphinScheduler等工作流调度框架;
了解Spark、Flink等大数据处理框架;
了解Git协作开发与CI/CD流程;
有开源项目贡献或技术博客者优先。