4255
❤️☠️🤗 идейная миграция небытия
#чтивонаночь по быстрому
RLTF: Reinforcement Learning from Unit Test Feedback
Ну короче, yet another RL paper, толльок тут используются Unit test signal, те код комплиться, выполняется, на выходе три вида ответа: Error, F ailure или Pass, решаем или нет и кормим фидбек + ревард дискретный и бьет модель по бошке за любые ошибки что позволяет не скатываться в низкий ревард ловушку.
ну и бонусом это все выдает SOTA на MBPP(ну типа prompt - code - unit test)
paper
код