Technical Support Engineer (GPU Clusters)
Together AI
Удалённо
Опубликовано менее 24 часов назад
AI-инфраструктура для inference, fine-tuning и GPU-кластеров
Задачи
- Решать сложные технические проблемы клиентов в Kubernetes GPU-кластерах;
- Работать как customer-facing SRE и поддерживать стабильность кластеров;
- Мониторить здоровье GPU-инфраструктуры и сообщать клиентам о hardware-инцидентах;
- Поддерживать production-инфраструктуру: Slurm, node repair, миграции и Kubernetes workloads.
Требования
- 3+ года в customer-facing technical roles, включая поддержку AI-сервиса или критичного SaaS API;
- Опыт SRE или DevOps-инженера с Kubernetes;
- Знание AI, ML, GPU-технологий и HPC-сред;
- Опыт с Slurm, InfiniBand или RDMA, сетями и distributed storage.
#support #ai #devops #technical #engineer
Навыки
Обновлено 5 августа
Ещё вакансии
Похожие вакансии
- Aston
УдаленноПолная занятость ЗП обсуждается на собеседовании В компанию Aston #manual Требования – опыт работы в роли Full-stack QA Engineer от 3,5 лет;…
SeniorУдалённоПолная занятостьзп не указанасегодня - Arenadata
Компания: Arenadata Что нужно делать: -Автоматизировать тестирование компонентов Arenadata Hyperwave (ADH) и Arenadata Hyperwave Cloud (ADHC): Spark,…
SeniorУдалённоПолная занятостьзп не указанасегодня - Kaspersky
Компания: Kaspersky Обязательно: · Опыт тестирования сложных распределённых систем от 5 лет, из них минимум 2 года в роли Lead QA. · Глубокое знание…
LeadОфисПолная занятостьзп не указанасегодня