Google перевернула генерацию данных для использования инструментов: сначала ответ, потом запрос
🧠 Google перевернула генерацию данных для использования инструментов: сначала ответ, потом запрос
По данным Google Research, новый фреймворк ToolGrad генерирует синтетические наборы данных для обучения агентов в обратном порядке: сначала строится корректная цепочка вызовов API, затем к ней подбирается пользовательский запрос. Классические подходы вроде ToolBench и ToolACE идут от запроса и используют поиск с возвратами, что дорого и даёт мало длинных последовательностей действий. ToolGrad вместо этого адаптирует идею текстовых градиентов из TextGrad: LLM-критик текстом описывает ошибки в сгенерированной цепочке, и четыре модуля — предложить, выполнить, выбрать, обновить — итеративно улучшают её до корректного рабочего процесса.
Для экспериментов взяли базу ToolBench с более чем 16 тысячами реальных API и сгенерировали небольшой набор данных ToolGrad-500. На нём дообучили Gemma-3 размером 1B, 4B и 12B, а оценивали на Berkeley Function Calling Leaderboard — это другой набор инструментов, то есть за пределами исходного распределения данных. Авторы заявляют почти 100% успешных проверок при генерации данных и снижение стоимости по сравнению с агентом, использующим поиск в глубину. Модели ToolGrad-12B, по их словам, сравнимы с проприетарными Gemini, GPT и Claude, а небольшие версии обходят специализированные ToolACE и Hammer-2.1-7B.
Конкретных цифр стоимости или очков на BFCL в блоге нет, только качественные формулировки «выше», «дешевле», «почти 100%». Это уже повод смотреть на результат с осторожностью: почти идеальная доля успешных проверок на этапе генерации может означать, что модель научилась порождать корректные, но тривиальные цепочки, а не решать сложные пользовательские задачи.
Инверсия «ответ раньше вопроса» логична для синтетических данных: имея эталонное решение, проще придумать к нему запрос, чем искать решение под случайную подсказку. Но главный вопрос — не в доле успешных проверок генератора, а в том, переносятся ли такие цепочки на реальные сценарии за пределами ToolBench. Пока это не доказано независимым тестированием, ToolGrad остаётся экономичным способом сгенерировать обучающие примеры, но не гарантией рабочего агента в рабочей среде.
#ToolGrad #tooluse #syntheticdata #Gemma #GoogleResearch
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.