-
5 年以上 DevOps 与云原生领域经验,擅长构建高可用、可扩展的 CI/CD 流水线和基础设施自动化平台
-
精通 Kubernetes、Docker、Terraform、Ansible 等工具,具备大规模集群运维与故障排查能力
-
熟悉 AWS、阿里云等云平台,能够设计并实施多云架构下的持续交付与监控告警方案
-
具备良好的团队协作与沟通能力,推动 DevOps 文化落地,提升研发效能与系统稳定性
DevOps 工程师 | 云原生与自动化运维专家
5 年以上 DevOps 与云原生领域经验,擅长构建高可用、可扩展的 CI/CD 流水线和基础设施自动化平台
精通 Kubernetes、Docker、Terraform、Ansible 等工具,具备大规模集群运维与故障排查能力
熟悉 AWS、阿里云等云平台,能够设计并实施多云架构下的持续交付与监控告警方案
具备良好的团队协作与沟通能力,推动 DevOps 文化落地,提升研发效能与系统稳定性
负责公司级云原生平台的建设与维护,支撑数千个微服务的持续交付与稳定运行
设计并落地基于 Kubernetes 的多集群管理方案,实现跨可用区的高可用部署与弹性伸缩
主导 CI/CD 流水线优化,将平均构建部署时间从 25 分钟降低至 8 分钟,显著提升研发效率
推动基础设施即代码(IaC)实践,使用 Terraform 和 Ansible 管理云资源,确保环境一致性
建立全面的监控告警体系,基于 Prometheus、Grafana 和 Alertmanager 实现秒级故障发现与响应
指导初级工程师,组织内部技术分享,推动 DevOps 最佳实践在团队内落地
参与电商核心系统的持续集成与持续部署平台开发,服务数百个业务团队
使用 Jenkins 和 GitLab CI 构建自动化流水线,集成代码扫描、单元测试和自动化部署
维护基于 Docker 和 Kubernetes 的容器化环境,优化资源利用率与调度策略
搭建 ELK 日志收集与分析平台,帮助开发团队快速定位线上问题
参与双十一大促保障,完成容量规划、压测和应急预案演练,确保系统平稳运行
负责游戏业务服务器的自动化运维与监控,保障 7x24 小时稳定运行
开发自动化运维脚本和工具,使用 Python 和 Shell 实现批量部署、配置管理和日志分析
参与构建内部 CMDB 和发布系统,提升运维操作的标准化与效率
协助处理线上故障,参与 root cause 分析并推动改进措施落地
表彰在云原生平台建设中展现出的卓越技术领导力与跨团队协作能力,推动研发效能显著提升。
因在 CI/CD 流水线优化和容器化改造中的突出贡献,获得部门技术创新奖。
探讨如何利用 Kubernetes 和 Argo CD 构建高效的持续交付流水线
分享多集群管理、灰度发布和自动化回滚的实践经验
分析云原生时代下 DevOps 团队面临的挑战与应对策略
设计并实现面向多团队的 CI/CD 平台,支持自动化构建、测试、镜像打包和部署
集成 Kubernetes、Argo CD、Harbor 和 SonarQube,提供端到端的持续交付能力
平台上线后支撑日均 2000+ 次构建部署,研发交付效率提升 40%
构建基于 Prometheus Operator 的监控体系,覆盖 500+ 微服务实例
设计自定义指标与告警规则,实现业务指标与基础设施指标的统一采集
接入 Grafana 统一看板和 Alertmanager 告警分发,故障平均发现时间缩短 70%
开发自动化运维平台,集成资产管理和批量执行功能
使用 Ansible 和 Python 实现配置管理、应用部署和巡检任务自动化
平台上线后减少 60% 的人工操作,提升运维效率与准确性
定期在社区分享云原生与 DevOps 技术实践,累计举办 10+ 场线上讲座
参与开源项目文档翻译与代码贡献,推动国内开源生态发展
担任技术大会志愿者,协助组织 DevOps 主题分论坛
协助组织月度技术沙龙,负责活动策划、嘉宾邀请和现场协调
运营社区技术微信群,解答成员问题并整理分享资料