Исследование подходов RL и борьба с reward hacking
Хороший ответ LLM обладает различными свойствами: полезностью, человечностью, фактологичностью, безопасностью, уместной структурой и другими. Для улучшения каждого из свойств мы используем методы RL, например GRPO, в основе которых лежат reward-модели, обученные оценивать отдельные аспекты ответа. При этом важно находить tradeoff-ы между аспектами и учитывать корреляцию и антикорреляцию разных reward-функций
Одна из самых интересных задач здесь — борьба с reward hacking. В ходе обучения модель может найти «дешёвую» стратегию повышения reward-а: злоупотреблять определённой структурой, повторять одни и те же обороты или использовать формулировки, которые нравятся reward-модели, но делают ответы менее естественными. Так возникают узнаваемые паттерны, из-за которых разные ответы начинают выглядеть одинаково. Отдельное направление нашей работы — дешаблонизация: поиск таких паттернов, создание диагностик и срезов, улучшение reward-моделей и методов обучения так, чтобы рост метрик действительно означал рост качества
Развитие человечности модели
Мы хотим, чтобы Alice AI была не просто системой, которая выдаёт правильный текст, а внимательным и естественным собеседником. Модель должна понимать, когда нужен короткий ответ, когда подробное объяснение, а когда — поддержка или участие. Здесь предстоит исследовать человечность как отдельный аспект качества и учить модель адаптироваться к собеседнику, не теряя полезности и точности
Персонализация
Мы учим модель работать с долгосрочными фактами о пользователе, чтобы общение с Alice AI становилось более личным и последовательным. Здесь есть несколько сложных задач: находить релевантные воспоминания в истории диалогов, использовать их только тогда, когда они действительно помогают ответу, и выбирать, какая информация достаточно важна для сохранения в долгосрочной памяти
При этом модель не должна запоминать случайный шум или навязчиво упоминать всё, что знает о человеке. Нужно находить баланс между персонализацией, естественностью и полезностью
Обучение на пользовательском сигнале (RLUF)
Ещё одно направление — RLUF, или Reinforcement Learning from User Feedback. Мы учимся улучшать модель непосредственно по сигналам от пользователей, например отметкам «Нравится» и «Не нравится». Такой сигнал максимально близок к реальному продуктовому качеству, но при этом он шумный и неоднородный: одна и та же оценка может отражать полезность, стиль, фактологическую ошибку или просто несовпадение с ожиданиями конкретного человека
Здесь предстоит исследовать, как очищать и интерпретировать пользовательский сигнал, превращать его в устойчивый обучающий reward и проверять, что модель становится действительно полезнее и человечнее, а не учится эксплуатировать поверхностные закономерности обратной связи
Модели с tool calling и reasoning
Мы разрабатываем рассуждающие модели, умеющие делать tool calling в ходе рассуждений. Учим их раскладывать сложную задачу на шаги, выбирать подходящий инструмент, корректно формировать вызовы, анализировать результаты и восстанавливаться после ошибок. Важно научить модель понимать, когда инструмент действительно нужен, а когда лучше ответить самостоятельно, и фокусироваться не просто на генерации убедительного текста, а на достижении результата, которого ожидает пользователь
Больше об ML в Яндексе — в канале Yandex for ML