Логотип Northline

Machine Learning Engineer

Northline · Віддалено (Україна, ЄС)

Відгукнутись на вакансіюОпубліковано 2 дні тому

Про роль

Інференс мовних моделей під навантаженням: латентність, вартість і якість відповіді — три числа, за які відповідає ця роль.

Що робити

  • виводити моделі в продакшен і тримати p95 у межах SLA
  • квантизація, батчинг, кешування — усе, що знижує вартість запиту
  • будувати пайплайни донавчання та офлайн-оцінки
  • працювати разом із дослідниками над якістю відповіді

Що потрібно

  • PyTorch і досвід сервінгу моделей (vLLM, TGI або власне рішення)
  • Kubernetes, CI/CD, моніторинг
  • уміння читати профайлер і не гадати, де вузьке місце

Зацікавила вакансія?

Відгук надсилається напряму до Northline.

Відгукнутись на вакансію

Схожі вакансії

Усі вакансії →