Не упустите лучшие вакансии!
Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!
Подключить ботаСтарший NLP-разработчик в Яндекс Клавиатуру
Мы ищем сильного инженера, который поможет нам развивать ML-модели в Клавиатуре и способствовать прорыву в понимании контекста, используя идеи из мира LLM. Вы сможете решать сложные задачи в продукте мирового уровня и влиять на каждый этап жизненного цикла моделей — от сбора данных до оптимизации инференса на мобильных устройствах. Результаты вашей работы будут использоваться миллиарды раз в день миллионами пользователей Клавиатуры и колоссально влиять на них: любое улучшение может суммарно экономить до нескольких лет жизни наших пользователей в день.
На Хабре можно почитать о нашей нейросетевой языковой модели и о тап-модели.
Какие задачи вас ждут
Изучать статьи в области NLP/LLM и выбирать перспективные решения для реализации в КлавиатуреВы будете следить за трендами в области NLP/LLM-моделей, разбирать статьи и оценивать их потенциал для внедрения в Клавиатуру. Также вам предстоит реализовывать архитектуры (например, xlstm, rwkv) из популярных статей и ставить эксперименты на всем спектре размеров моделей.
Экспериментировать с данными: фильтрация, синтетика и другие направления
Качество языковых моделей в Клавиатуре сильно зависит от используемых данных. Мы начинаем эксперименты с различными подходами для сбора обучающих данных, таких как как фильтрация при помощи LLM и генерация синтетических данных. Вам предстоит углубиться в эти подходы и масштабировать их.
Экспериментировать со схемой обучения, уменьшать время для проверки гипотез
Сейчас каждая модель Клавиатуры обучается с нуля, и проверка гипотез занимает несколько дней. Мы хотим уменьшить это время за счёт оптимизации как обучения, так и его схемы с претрейн-моделью, поверх которой можно быстро ставить эксперименты.
Экспериментировать с применением LLM в Клавиатуре
Недавно мы запустили продвинутое исправление опечаток и грамматических ошибок на базе небольшой 0.5B YandexGPT-модели, мы хотим и дальше продолжать искать точки внедрения LLM в Клавиатуру и собирать прототипы с ними. Из ближайших задач — генерация полноценных ответов в мессенджерах с собеседником.
Мы ждем, что вы
- Отлично ориентируетесь в классических подходах машинного обучения
- Разбираетесь в основных концепциях NLP
- Следите за SOTA-подходами, читаете статьи
- Работали с PyTorch, TensorFlow или другими DL-фреймворками
Будет плюсом, если вы
- Знакомы с SQL
- Имеете опыт внедрения ML-моделей on-device на базе TensorFlow Lite
- Знакомы с C++
Ваше резюме увидят первым!
Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!
Подключить автоподнятие