🔥

Не упустите лучшие вакансии!

Подключите наш Telegram-бот и получайте мгновенные уведомления о новых предложениях из 10+ источников. Будьте первым, кто откликнется!

Подключить бота

Java Technical Lead

ПАО Сбербанк
г Москва
Работа в офисе
Опубликовано: 06 Oct 2025

Описание

**ИТ B2C** — самая крупная экосистема в Сбере. Нас более 8000 человек в 18 городах России. Мы занимаемся разработкой и развитием розничных решений, помогая сделать сервисы Банка доступнее, безопаснее и удобнее. Ждем именно тебя! **Мы – Команда SberProfile B2C** – создаем и развиваем цифровой профиль клиента Сбера и его экосистемы. * Задача команды – спроектировать и реализовать кэш нового поколения, который станет единственным источником актуальных данных для AI-агентов Сбера. Это не просто хранилище, а сверхбыстрый (до 10 мс задержки) слой между агентами и данными. * У задачи есть глубокая RnD составляющая – таких решений на таких объемах данных не делал еще никто. Мы работаем на стыке distributed systems, AI и low-latency разработки – скучно не будет!

Обязанности

* Проектирование и развитие онлайн хранилища фичей: * Настройка и оптимизация low-latency хранилищ (Redis, Ignite, Cassandra) для "горячего кэша" фичей. * Разработка и поддержка системы индексации и партиционирования данных для обеспечения минимального latency при чтении по ключам сущностей (entity\_keys). * Реализация стратегий TTL (Time-To-Live), управления версиями фич и схем данных внутри Online Store. * Построение и оптимизация пайплайнов материализации: * Разработка, внедрение и поддержка высокопроизводительных пайплайнов для наполнения Online Store: * Batch Sync: Эффективная синхронизация актуальных данных из Offline Store (S3, BigQuery, Hive) в Online Store (оптимизация дельт, инкрементальные обновления). * Streaming Ingestion: Реализация пайплайнов реального времени (Kafka -> Flink/Spark Streaming/native processors) для вычисления и загрузки фич в Online Store с минимальной задержкой. * Разработка механизмов дедупликации, упорядочивания событий (event ordering), гарантии доставки (delivery guarantees - at least once/exactly once) в стриминговых пайплайнах. * Оптимизация пропускной способности (throughput) и задержки (latency) пайплайнов. * Интеграция с Serving Layer и SDK: * Тесная работа с командой, разрабатывающей Feature Store SDK/API, для обеспечения эффективного и надежного доступа к данным из Online Store. * Оптимизация протоколов запросов (gRPC, REST, Redis Protocol) и форматов данных (Protobuf, Arrow, native) для минимизации latency чтения. * Реализация и оптимизация механизмов batch-запросов (multi-get) к Online Store. * Обеспечение Согласованности (Consistency): * Гарантия, что логика вычисления фич в пайплайнах материализации (особенно streaming) идентична логике, используемой для генерации исторических данных в Offline Store. * Разработка и поддержка механизмов проверки согласованности данных между Offline и Online Store. * Мониторинг, Алертинг и Операционная Надежность (SRE подход): * Настройка комплексного мониторинга ключевых метрик Online Store и наполнениня: Latency, Throughput, Error Rates, Freshness (lag от реального времени), Utilization, Data Quality metrics in Online. * Создание эффективных систем алертинга для оперативного реагирования на инциденты. * Разработка практик Disaster Recovery (DR) и Backup/Restore для Online Store.

Требования

* Глубокое понимание концепции Feature Store, его роли в ML lifecycle, различий между Offline и Online Store * Знание принципов работы Feature Store SDK (запросы, point-in-time correctness для offline, online lookup) * Понимание внутреннего устройства и характеристик минимум одной популярной KV-базы (Redis, Ignite, Cassandra), в т.ч настройка, профилирование и оптимизация производительности. * Профильный язык: Python (с акцентом на asyncio, оптимизацию), Java/Scala (для Flink/Spark/Kafka Streams) или Go. * Умение писать эффективный, масштабируемый и поддерживаемый код для пайплайнов материализации и доступа к данным. * Знание сетевых протоколов (gRPC, HTTP/2) и сериализации (Protobuf, Apache Arrow, Parquet). * Глубокие знания принципов и паттернов low-latency систем (CAP теорема, consistency vs availability vs latency) * Опыт проектирования API для real-time inference * Опыт работы с Apache Kafka, Apache Flink, Spark Streaming, Kafka Streams, или Dataflow. * Опыт построения отказоустойчивых систем (HA, репликация, шардирование) * Навыки анализа latency-path, оптимизации throughput/latency * Опыт работы с Kubernetes, Helm, CI/CD (GitLab CI, ArgoCD) * Навыки общения с DS/ML-инженерами, понимание ML lifecycle * Понимание концепций: exactly-once/at-least-once семантик, watermarking, state management, event time processing * Владение инструментами мониторинга Prometheus, Grafana, Datadog и практиками SRE: SLI/SLO/SLA, алертинг на основе SLO, error budgets. * Будет большим плюсом: * Опыт работы с конкретными Feature Store (Feast, Tecton, Vertex AI Feature Store, SageMaker Feature Store, Hopsworks и др.). * Глубокое понимание feature monitoring (свежесть, дрейф, качество) применительно к Online Store. * Опыт работы с системами кэширования за пределами Feature Store (CDN, Memcached, Varnish).

Условия

* гибридный/офисный формат работы * годовой бонус и ежегодный пересмотр * расширенный ДМС с первого дня + стоматология и льготное страхование для семьи * корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях * офис на Кутузовской/Оружейной с видом на набережную, зонами отдыха и спортзалом * 90 дней удаленной работы из любого региона РФ (не применимо для сопровождения) * льготная ипотека в Сбере, корпоративная пенсионная программа, подписка СберПрайм+, скидки от партнеров и сервисов группы компаний.
🚀

Ваше резюме увидят первым!

Автоматическое поднятие на HeadHunter каждые 4 часа. Увеличьте свои шансы на успех в 10 раз!

Подключить автоподнятие