返回岗位列表
Infrastructure全职工作地点:深圳
大模型 Infra 工程师
设计与构建高效 AI 基础设施平台,支撑大模型训练/推理/部署与 MLOps 体系,优化硬件资源使用与端侧部署。
深圳团队:Infrastructure
投递简历岗位职责
- AI 基础设施规划与建设:设计和构建高效的 AI 基础设施平台,构建支持大模型训练/推理/部署的统一技术平台,设计并实现高效可扩展的 MLOps 体系,支撑模型快速迭代。
- 深入优化平台的性能和硬件资源使用效率,优化 AI 模型的存储和计算资源利用(包括 GPU/TPU、内存、带宽、存储等),提升系统的可靠性、性能和扩展性。
- 负责将 AI 模型(如 CNN、Transformer、Diffusion 等)部署到多种边缘设备(如手机、嵌入式设备、IoT 设备等),并进行模型量化加速。
- 构建健康/健身领域的数据采集、清洗、标注和管理平台,设计数据隐私保护机制,建立数据质量监控体系。
- 团队建设与协作:与算法、应用、产品等团队紧密协作,推动 AI 能力落地,建立技术规范和最佳实践,提升整体工程效率。
任职要求
- 计算机科学、人工智能或相关专业硕士及以上学历,3 年以上 AI Infra 架构设计或分布式系统开发经验。
- 精通 Kubernetes、Docker、Hadoop、Spark 等分布式系统技术,具备大规模计算集群的部署和运维经验;具备云计算平台(如 AWS、阿里云等)上的资源管理和部署经验,有 MLOps 平台建设经验(MLflow、Kubeflow 等)。
- 有 GPU/TPU 加速集群的构建和优化经验,了解 NVIDIA CUDA、TensorRT、vLLM 等深度学习推理优化工具;优秀的性能调优技能,能够分析并解决分布式环境中的性能瓶颈,熟悉 GPTCache、KVCache 等。
- 精通 Python/Go/C++ 中至少一门语言,深入理解 Transformer 架构和大模型训练/推理技术,熟练掌握主流深度学习框架(PyTorch、DeepSpeed、Megatron 等),有 Llama/Qwen 等大模型微调和服务化经验。
- 熟练使用推理引擎(如 ONNX Runtime、MNN)进行模型的转换、量化、剪枝和优化,熟悉端侧性能调优,包括算子融合、内存优化、异构计算(CPU/GPU/NPU)调度,以降低延迟和功耗。
- 出色的沟通能力,善于跨团队协作,具有支持多团队 AI 项目的经验。
简历请发送至 career@speediance.com