Machine Learning Engineer
Northline · Віддалено (Україна, ЄС)
Відгукнутись на вакансіюОпубліковано 2 дні тому
Про роль
Інференс мовних моделей під навантаженням: латентність, вартість і якість відповіді — три числа, за які відповідає ця роль.
Що робити
- виводити моделі в продакшен і тримати p95 у межах SLA
- квантизація, батчинг, кешування — усе, що знижує вартість запиту
- будувати пайплайни донавчання та офлайн-оцінки
- працювати разом із дослідниками над якістю відповіді
Що потрібно
- PyTorch і досвід сервінгу моделей (vLLM, TGI або власне рішення)
- Kubernetes, CI/CD, моніторинг
- уміння читати профайлер і не гадати, де вузьке місце