度小满 社会招聘
K8s运维工程师
北京 ·经验不限·学历不限
北京
薪资面议
前往 度小满 官网投递
职位描述
1. 集群建设与维护: 负责公司 Kubernetes 集群的规划、部署、配置管理、扩缩容、版本升级及平滑迁移;支持 CPU 和 GPU 异构计算集群的建设与运维。
2. 高可用与容灾管理: 负责 K8s 集群的高可用架构设计与实施,定期进行容灾演练、etcd 数据备份与恢复测试,确保核心业务容器化服务 7x24 小时稳定运行。
3. 监控与告警完善: 结合 Prometheus、Grafana、Alertmanager 等监控工具,完善集群和应用层面的监控体系,优化告警策略,减少误报漏报。
4. 参与主导故障排查: 快速响应并解决线上 K8s 集群及容器化应用的突发故障,输出故障复盘报告,持续优化集群稳定性。
5. 研发规范与最佳实践: 为业务研发团队提供容器化改造方案和 K8s 使用最佳实践,解决研发在容器化过程中遇到的疑难杂症。
6. 自动化运维建设: 沉淀运维能力,基于 Helm、Operator 等工具研发自动化运维平台,实现应用一键部署、灰度发布、弹性伸缩等能力,提升 K8s 交付和运维效率。
【任职要求】
1. 本科及以上学历,计算机或相关专业,具备 2-5 年中大型互联网公司 Kubernetes 运维经验。
2. 核心技能精通:
- Kubernetes 核心能力: 精通 K8s 核心资源对象(Pod、Deployment、Service、PV/PVC 等)的使用和故障排查;熟练使用 kubectl、Helm 等工具进行集群管理和应用编排。
- 架构深度理解: 深入理解 K8s 架构原理,熟悉 核心组件的工作机制;了解 K8s 的资源调度算法、Pod 生命周期管理、服务发现与负载均衡原理。
- CPU/GPU 集群运维: 熟悉 CPU 和 GPU 异构集群的资源管理与调度,具备 GPU 节点的部署、配置和调优经验;能解决 GPU 资源分配、共享和隔离等实际问题。
3. 扩展能力熟悉: 熟悉容器运行时(Docker、containerd 等)的原理与配置;了解 K8s 网络插件(Calico、Cilium 等)和存储插件(Ceph、NFS、云厂商 CSI)的部署与调优。
4. 开发与自动化能力: 熟练掌握 Shell 脚本,至少掌握 Python 或 Go 其中一门语言;熟练使用 Ansible/SaltStack 等自动化配置工具;具备基于 Helm Chart 或 Kubernetes Operator 进行应用封装和管理的能力。
5. 综合素质: 具备强烈的责任心和敬业精神,抗压能力强(能适应一定频率的 On-Call),具备优秀的逻辑思维能力、问题分析能力和团队沟通能力。
6. AI 大模型应用能力: 能够熟练使用 AI 大模型(如 ChatGPT、Claude等)辅助日常运维工作,包括故障诊断、脚本编写、文档生成等场景,提升工作效率。
【加分项】
1. 性能调优: 深入分析 K8s 集群运行瓶颈,从操作系统、容器运行时、网络、存储、调度器等层面进行深度调优;有大规模集群(500+ 节点)或高并发场景下的性能优化经验。
2. 系统与网络基础: 扎实的 Linux 操作系统基础,熟悉 TCP/IP 协议栈、iptables/nftables 等底层技术;能熟练使用 tcpdump、strace、perf、top 等系统排障工具进行深度问题排查。
3. 云原生生态工具链: 熟悉 Service Mesh(Istio、Linkerd)、CI/CD 工具链(Jenkins、GitLab CI、ArgoCD)、镜像仓库(Harbor)等云原生生态组件的部署与运维。
4. 源码阅读与贡献能力: 具备源码阅读能力(Go 语言),能从源码层面排查过 K8s 核心组件的底层 Bug 或性能问题;有为 K8s 或相关开源项目提交过 PR 者优先。
5. 安全与合规: 了解 K8s 安全最佳实践(RBAC、PSP/PSA、Network Policy、镜像扫描等);有容器安全加固和合规审计经验者优先。
6. 认证与社区活跃度: 持有 CKA(Certified Kubernetes Administrator)或 CKAD 或 CKS 证书;活跃于 K8s 或云原生社区者优先。
7. 多云与混合云经验: 有公有云托管 K8s 服务(阿里云 ACK、腾讯云 TKE、AWS EKS 等)或混合云、多集群管理经验者优先。
官网发布:2026-07-31 · 最后确认在招:2026-09-03 19:37:04 · 来源平台:feishu