邱先生 求职中

邱先生

运维经理 · 云原生专家 / Kubernetes · DevOps · SRE

男 · 38岁 本科 · 13年5个月经验 离职 · 可立即到岗

个人总结

拥有 8 年云原生体系实践经验,过往主导的云原生迁移项目,曾成功支撑业务吞吐量的十倍增长,并实现年度基础设施成本优化 30% 以上。专注于 Kubernetes 容器化平台管理与优化,熟悉 DevOps 全流程实施,擅长构建高效自动化运维体系。

13
IT 运维经验
8
云原生实践
99%+
SLA 达标率
1.2PB
存储平台规模

核心优势 // highlights

Kubernetes 高级运维
精通集群部署、监控告警、性能调优及故障排查,主导多个大型生产环境 K8s 集群的规划建设与日常维护。
GitOps 与 DevOps
熟练运用 ArgoCD / Tekton 实现基础设施即代码(IaC),建立完善 CI/CD 流水线,显著提升部署效率与系统稳定性。
SRE 可靠性工程
通过指标监控(SLIs/SLOs)、容量规划保障系统可靠性,SLA 达标率长期 99% 以上,MTTD 从 10 分钟降至 1 分钟内。
PaaS 平台建设
主导企业级容器云平台架构设计与落地,支持微服务架构下数百个业务应用的稳定运行。
Linux 深度运维
资深 Linux 系统管理员,对内核参数调优有深入理解,TCP/IP 网络协议栈优化经验丰富。
自动化与脚本开发
Python/Shell 脚本开发能手,Ansible/Terraform 配置管理熟练,实现基础设施版本控制与标准化管理。

工作经历 // experience

某游戏公司
资深 DevOps 工程师(多云方向)
2025.12 — 2026.09
AWS EC2 VPC CloudFront ALB Route53 RDS MemoryDB EKS k3s S3 ECR IAM Terraform Jenkins Harbor MongoDB Redis Elasticsearch Cloudflare
  • 多云基础设施与规模化交付:以 AWS 为主干管理 6–10 个云账号、覆盖香港/新加坡/首尔/us-east-1 共 4 个区域、500+ 台服务器;配合阿里云、腾讯云、Linode、Cloudflare 及多家 CDN 构建混合分发架构。主导 13+ 个项目从 0 到 1 交付,沉淀为「EC2 + docker-compose」与「EKS/k3s + Helm」两套标准化交付模板,新项目可按模板快速复制上线。
  • 容器与平台(EKS + 自建 k3s):生产环境运行 EKS 1.34 托管集群(4 节点组)及 3 套自建 k3s 集群;使用 Terraform 两套 root 模块(infra + edge)管理 VPC/EKS/RDS/ElastiCache/S3/CloudFront/WAF 全栈基础设施;Jenkins 46 条流水线 + Harbor 项目化镜像仓库,实现按 digest 部署、秒级回滚
  • 数据可靠性与容灾体系:设计并固化《数据备份八阶段 SOP》,通过「集合级校验 + gzip 完整性 + 双端 MD5 + 隔离实例恢复实测」四层验证,累计完成约 2.4 亿文档备份与恢复,零失败、逐集合零差异;单次最大处理 1.74 亿文档 / 29.3 GB。通过将大集合分片键从随机 UUID 改为时间字段,导出性能提升约 100 倍
  • 稳定性治理与成本优化:主导 Hazelcast 集群脑裂重大故障复盘与根治(135 成员集群),通过 12 项参数调优 + 全量缩容分批扩容,同类事故处置从 21 小时 → 1 小时;治理 MongoDB fd 耗尽崩溃循环 2172 次、memcg OOM、ES 只读等 8 类生产故障;通过实例降配、日志压缩入 S3 生命周期、ES 索引 ISM 策略释放 57 GB 磁盘,建立 Cost Explorer 账单日报闭环。
厦门紫京阁网络科技有限公司
运维经理
2018.12 — 2025.10
  • 生产级 K8S 架构演进与成本优化:主导生产环境 K8S 集群全生命周期管理(搭建/平滑升级);引入 Helm 实现应用部署标准化;利用 Resource Quota & LimitRange 解决资源争抢。通过 HPA + Keda 弹性伸缩,成功应对业务峰值,年度基础设施成本下降 25%
  • GitOps 与自动化部署体系:引入 Tekton + ArgoCD 构建云原生 CI/CD 管道。将 GitOps 理念落地,实现全环境配置声明式管理。新环境交付从 3 天 → 30 分钟,确保开发至生产环境 100% 一致性。
  • 全栈可观测性建设:落地基于 Prometheus + Grafana 的深度监控体系。通过多维指标聚合与精准告警治理,MTTD 从 10 分钟 → 1 分钟内
好慷在家
运维经理
2017.11 — 2018.11
  • 异构数据库高可用落地:主导并完成 MSSQL 跨环境数据同步方案;负责 PostgreSQL 高可用主从架构设计,保障核心数据资产强一致性。
  • 微服务容器化转型:推动业务从传统部署向 Docker 容器化迁移;在阿里云 ACK 落地 K8S 集群运维,实现业务快速上云。
  • CI/CD 早期实践:搭建 Jenkins 流水线,打通从代码提交到容器镜像构建、自动分发的全链路。
厦门网昌网络科技有限公司
高级运维工程师
2015.11 — 2017.08
  • 企业级版本控制体系:部署并维护 GitLab 私有仓库,推动研发团队实现代码版本管理标准化。
  • 数据库架构攻坚:深度参与并主导 MySQL Galera Cluster 落地,实现多主并发读写与高可用;负责 PostgreSQL 流复制架构运维。
  • 应用架构优化:负责 Tomcat 集群部署,结合 Nginx Session 保持技术解决高并发下的状态一致性问题。
  • 日志与监控闭环:落地 ELK Stack 集中式日志分析平台,提升排障效率;通过 Zabbix 实现业务指标深度监控。
厦门伟景信息科技有限公司
运维工程师
2013.03 — 2015.09
  • 全链路监控体系构建(Zabbix):从零搭建并维护 Zabbix 监控系统,对 60+ 台服务器关键指标实时监控;利用 Zabbix Proxy 解决跨机房监控延迟问题,核心业务告警响应分钟级。
  • 数据库高可用落地:主导 MongoDB Replica Set 副本集架构及 MySQL 主从复制,对数据库同步延迟、连接数、Slow Query 深度监控。
  • 应急响应与安全防护:成功处置服务器入侵事件;解决跨境防火墙导致的静态资源加载失败问题,优化海外业务可达性。

项目经历 // projects

PB 级云原生分布式存储平台落地
项目方案负责人
2020.04 — 2021.01

为解决 k8s、大模型及应用程序的存储问题,主导对多款开源分布式存储系统进行评估选型,同时对现有存储需求进行预估并落地一套支持文件和对象存储的存储底座,为上层业务提供高性能、高可靠、低成本的共享存储服务。

核心职责
  • 针对海量小文件、应用数据文件及基础服务数据,对多个存储平台进行对比分析,选定 CubeFS 为最终存储底座
  • 主导存储平台的资源预估和部署,根据文件数量、存储空间预估硬件需求
  • 负责存储服务化和运维管理体系,为不同业务系统配置独立的用户名、权限和存储卷,根据实时使用率制定监控和节点扩容方案
项目成果
  • 成功建立公司多协议、高扩展、高可用的统一存储平台,对外提供对象存储和文件存储,满足数据湖、应用程序对存储的差异化需求
  • 弥补了 K8s 存储能力的缺陷,让基础服务的交付周期从天级别缩短至分钟级
  • 平台稳定运行,累计数据量已超 1.2PB,成功支撑几十个模型服务和数百个基础组件服务
基于 Jenkins 的统一 DevOps 平台落地
项目方案负责人
2018.05 — 2018.10

为应对公司业务快速发展带来的应用发布挑战,主导对现有的 DevOps 平台进行优化,实现基于 Jenkins Pipeline 的 CI/CD,对应用多环境发布进行升级改造,提升构建和交付效率。

核心职责
  • 优化 DevOps 平台流水线,设计并引入基于 K8s 的动态 Slave,设计应用一次构建多次部署方案,基于 Helm 实现应用全自动部署
  • 主导 CI/CD 流水线重构,设计可复用的多阶段流水线模板,配置采用 Gitlab 统一管理
  • 引入 Kaniko 替代原有 Docker 方案,实现无需特权模式的镜像构建
项目成果
  • 通过引入 K8s 动态 Slave,解决应用构建排队问题,整体构建任务耗时降低约 40%,基于标准化 Pipeline 降低 CI/CD 配置工作量 70%
  • 优化后的平台为超过 15 个核心系统提供稳定构建能力,单日构建数量达 1000 次

教育经历 // education

湖北工业大学 本科
计算机科学与技术
2017.03 — 2019.07
华中科技大学 985 / 211 / 双一流
建筑工程技术 · 大专
2014.03 — 2016.07

技术技能 // skills

容器与云原生平台
Kubernetes Docker Helm ArgoCD Tekton HPA Keda
DevOps 与 CI/CD
Jenkins GitOps CI/CD Ansible Terraform Python Shell
监控与可观测性
Prometheus Grafana ELK Stack Zabbix
数据库与存储
MySQL PostgreSQL MongoDB 副本集 MSSQL Redis Cluster/Sentinel Elasticsearch CubeFS 分布式存储
云平台与基础设施 多云:AWS(主力)/ 阿里云 / 腾讯云 / Cloudflare
Amazon EKS k3s EC2 VPC CloudFront ALB Route53 RDS MemoryDB S3 ECR Cloudflare 阿里云 OSS/CDN 腾讯云 EdgeOne Linode 阿里云 ACK
操作系统与网络
Linux TCP/IP Nginx