张伟

DevOps 工程师 | 云原生与自动化运维专家

📧zhangwei.devops@example.com 📞+86 138 0013 8000 🔗https://zhangwei.devops.example.com
📍中国,北京,北京,北京市海淀区中关村大街 27 号,100085
GitHub: @zhangwei-devops LinkedIn: @zhangwei-devops Zhihu: @zhangwei-devops

简介

  • 5 年以上 DevOps 与云原生领域经验,擅长构建高可用、可扩展的 CI/CD 流水线和基础设施自动化平台

  • 精通 Kubernetes、Docker、Terraform、Ansible 等工具,具备大规模集群运维与故障排查能力

  • 熟悉 AWS、阿里云等云平台,能够设计并实施多云架构下的持续交付与监控告警方案

  • 具备良好的团队协作与沟通能力,推动 DevOps 文化落地,提升研发效能与系统稳定性

教育背景

清华大学
硕士,计算机科学与技术,成绩:3.9/4.0
  • 研究方向为云原生计算与自动化运维,参与多项实验室科研项目

  • 荣获清华大学优秀研究生称号,多次获得学业奖学金

课程:分布式系统、云计算与虚拟化、高级操作系统、计算机网络、数据库系统、软件工程
北京邮电大学
学士,软件工程,成绩:3.7/4.0
  • 系统学习计算机科学与软件工程核心课程,奠定扎实的编程与系统设计基础

  • 担任班级学习委员,组织多次技术分享与编程竞赛

课程:数据结构与算法、操作系统、计算机网络、数据库原理、软件测试、编译原理

工作经历

字节跳动
高级 DevOps 工程师
  • 负责公司级云原生平台的建设与维护,支撑数千个微服务的持续交付与稳定运行

  • 设计并落地基于 Kubernetes 的多集群管理方案,实现跨可用区的高可用部署与弹性伸缩

  • 主导 CI/CD 流水线优化,将平均构建部署时间从 25 分钟降低至 8 分钟,显著提升研发效率

  • 推动基础设施即代码(IaC)实践,使用 Terraform 和 Ansible 管理云资源,确保环境一致性

  • 建立全面的监控告警体系,基于 Prometheus、Grafana 和 Alertmanager 实现秒级故障发现与响应

  • 指导初级工程师,组织内部技术分享,推动 DevOps 最佳实践在团队内落地

关键字:Kubernetes、云原生、CI/CD、Terraform、监控告警
阿里巴巴集团
DevOps 工程师
  • 参与电商核心系统的持续集成与持续部署平台开发,服务数百个业务团队

  • 使用 Jenkins 和 GitLab CI 构建自动化流水线,集成代码扫描、单元测试和自动化部署

  • 维护基于 Docker 和 Kubernetes 的容器化环境,优化资源利用率与调度策略

  • 搭建 ELK 日志收集与分析平台,帮助开发团队快速定位线上问题

  • 参与双十一大促保障,完成容量规划、压测和应急预案演练,确保系统平稳运行

关键字:Jenkins、GitLab CI、Docker、ELK、阿里云
腾讯科技
运维开发工程师
  • 负责游戏业务服务器的自动化运维与监控,保障 7x24 小时稳定运行

  • 开发自动化运维脚本和工具,使用 Python 和 Shell 实现批量部署、配置管理和日志分析

  • 参与构建内部 CMDB 和发布系统,提升运维操作的标准化与效率

  • 协助处理线上故障,参与 root cause 分析并推动改进措施落地

关键字:Python、Shell、自动化运维、CMDB、监控

语言

中文:母语或双语水平
关键字:普通话二级甲等
英语:完全专业水平
关键字:CET-6、TOEFL 105
日语:初级水平
关键字:JLPT N4

专业技能

容器与编排:专家
关键字:Kubernetes、Docker、Helm、Istio、Containerd
云平台:高级
关键字:AWS、阿里云、腾讯云、Azure、多云架构
CI/CD:高级
关键字:Jenkins、GitLab CI、Argo CD、GitHub Actions、Tekton
基础设施即代码:高级
关键字:Terraform、Ansible、Pulumi、CloudFormation
监控与日志:中级
关键字:Prometheus、Grafana、ELK、Loki、Alertmanager
编程语言:高级
关键字:Python、Go、Shell、Java、SQL

荣誉

年度优秀员工
字节跳动

表彰在云原生平台建设中展现出的卓越技术领导力与跨团队协作能力,推动研发效能显著提升。

技术创新奖
阿里巴巴集团

因在 CI/CD 流水线优化和容器化改造中的突出贡献,获得部门技术创新奖。

证书

AWS Certified DevOps Engineer – Professional
Amazon Web Services
Certified Kubernetes Administrator (CKA)
Cloud Native Computing Foundation
Red Hat Certified Engineer (RHCE)
Red Hat

出版刊物

基于 Kubernetes 的云原生持续交付实践
中国 DevOps 社区
  • 探讨如何利用 Kubernetes 和 Argo CD 构建高效的持续交付流水线

  • 分享多集群管理、灰度发布和自动化回滚的实践经验

  • 分析云原生时代下 DevOps 团队面临的挑战与应对策略

项目

云原生 CI/CD 平台
基于 Kubernetes 和 Argo CD 的企业级持续集成与持续交付平台
  • 设计并实现面向多团队的 CI/CD 平台,支持自动化构建、测试、镜像打包和部署

  • 集成 Kubernetes、Argo CD、Harbor 和 SonarQube,提供端到端的持续交付能力

  • 平台上线后支撑日均 2000+ 次构建部署,研发交付效率提升 40%

关键字: Kubernetes、Argo CD、CI/CD、云原生
微服务监控告警系统
面向大规模微服务的可观测性平台,提供指标、日志和告警能力
  • 构建基于 Prometheus Operator 的监控体系,覆盖 500+ 微服务实例

  • 设计自定义指标与告警规则,实现业务指标与基础设施指标的统一采集

  • 接入 Grafana 统一看板和 Alertmanager 告警分发,故障平均发现时间缩短 70%

关键字: Prometheus、Grafana、可观测性、微服务
自动化运维平台
基于 Ansible 的自动化运维管理平台
  • 开发自动化运维平台,集成资产管理和批量执行功能

  • 使用 Ansible 和 Python 实现配置管理、应用部署和巡检任务自动化

  • 平台上线后减少 60% 的人工操作,提升运维效率与准确性

关键字: Ansible、Python、自动化运维、CMDB

兴趣爱好

开源:Kubernetes、Prometheus、Terraform
运动:跑步、游泳、骑行
摄影:风光摄影、人像摄影

志愿服务

中国开源软件推进联盟
社区讲师
  • 定期在社区分享云原生与 DevOps 技术实践,累计举办 10+ 场线上讲座

  • 参与开源项目文档翻译与代码贡献,推动国内开源生态发展

  • 担任技术大会志愿者,协助组织 DevOps 主题分论坛

北京 DevOps 社区
志愿者
  • 协助组织月度技术沙龙,负责活动策划、嘉宾邀请和现场协调

  • 运营社区技术微信群,解答成员问题并整理分享资料