ИИ и данные

Аналитик-разработчик в команду этики и безопасности Alice AI

Яндекс · Москва · Не указано

Зарплата не указана

PythonSQLLLM

Alice AI — большая языковая модель, которая помогает миллионам людей решать повседневные задачи. Чтобы взаимодействие с ней было по-настоящему полезным, ответы должны быть не только релевантными, но и достоверными, доброжелательными и безопасными. Мы формируем команду, которая отвечает за безопасность и ответственное поведение LLM в рамках общего трека развития моделей Alice AI. Команда участвует в подготовке данных и обучении моделей, разрабатывает автоматизированные системы оценки, исследует потенциальные риски и проводит финальную приёмку релиз-кандидатов. Роль остаётся прежде всего аналитической: непосредственным обучением моделей занимается отдельная ML-команда, а мы исследуем их поведение, готовим данные, создаём системы оценки и отвечаем за качество релизных решений. Анализ данных и поиск проблемных сценариев В логах Alice AI представлены самые разные сценарии: голосовые и текстовые запросы, генерация изображений, взаимодействие с несколькими моделями — от команды «включи будильник» до продолжительных ролевых диалогов. Вам предстоит исследовать большие объёмы данных, выделять сложные срезы и находить потенциально проблемные паттерны. Мы анализируем реальные пользовательские взаимодействия, формулируем гипотезы о новых классах рисков и проектируем сценарии для red teaming. Разработка LLM-джаджей и агентских пайплайнов Чтобы научить модель корректно отвечать на сложные запросы, необходимо уметь измерять качество её поведения. Мы создаём автоматизированные системы оценки на основе подхода LLM-as-a-Judge, промптинга и агентских пайплайнов. Вам предстоит разрабатывать критерии и рубрики оценки, собирать evaluation-пайплайны, валидировать автоматические оценки на человеческой разметке и исследовать качество джаджей: их устойчивость, согласованность, смещения, precision и recall. Участие в обучении LLM Яндекса Мы собираем и валидируем обучающие выборки для этапов SFT и RL, анализируем ошибки модели и определяем направления для её дальнейшего улучшения. Задача команды — встроить требования к ответственному поведению в общий цикл разработки LLM и обеспечить измеримый рост качества на целевых категориях запросов. Финальная приёмка моделей Перед запуском новой версии необходимо убедиться, что она улучшает целевые метрики и не создаёт неприемлемых рисков. Мы разрабатываем наборы тестов и офлайн-метрики, сравниваем релиз-кандидаты с текущей моделью, анализируем регрессии и статистическую значимость изменений. По результатам оценки команда принимает решение о готовности модели к запуску. Больше об аналитике в Яндексе — в канале Yandex for Analytics Уверенно владеете Python и SQL Самостоятельно работаете с данными: исследуете логи, формулируете гипотезы Знаете математическую статистику и теорию вероятностей, умеете корректно строить эксперименты и интерпретировать результаты Умеете ясно излагать мысли, обсуждать решения и аргументированно отстаивать свою позицию Работали с ML-моделями и понимаете основные этапы их обучения и оценки Создавали LLM-джаджей, автоматизированные evaluation-пайплайны или проводили red teaming Знакомы с SFT, RLHF/RLAIF и современными подходами к LLM evaluation Понимаете типовые сценарии использования и уязвимости генеративных моделей

Дата объявления: . Проверь актуальные условия в первоисточнике.

Открыть первоисточникСохранить и сравнить с профилем