📊 Тест пеликанов: цена рассуждений в Claude Fable 5.1 растёт скачками На уровнях low и medium новая модель Anthropic не потратила ни одного токена на рассуждения — а на max выдала 65 927 токенов и счёт $3.30 за один SVG-файл. По данным Simon Willison, это первый случай, когда он видит такой разброс внутри одной модели. Anthropic в анонсе хвасталась 52.6% на Terminal-Bench-Science 0.1 против 24.7% у прошлой версии — но этот тест не имеет отношения к задаче «нарисуй пеликана». У модели пять предустановленных уровней усилий: low, medium, high, xhigh, max, отключить рассуждения нельзя. Разница между low и high почти незаметна: 1 998 и 2 612 выходных токенов, 23.8 и 29.6 секунды, 10 и 13 центов. Но xhigh уже потратил 36 767 токенов, 7 минут 51 секунду и $1.83, а max — 65 927 токенов, 13 минут 54 секунды и $3.30. Качество выросло: на max появились шлем, корзинка с рыбой, правильное расположение ног. Но разница между xhigh и max — уже нюансы вроде изгиба вилки велосипеда. Самый показательный момент — анимация. Willison не захотел платить ещё $3 и пропустил статичного max-пеликана через уровень high с запросом «animate this»: 6 121 входных токенов, 26 201 выходной, $1.37. Колёса в MP4 крутятся в неправильную сторону, но в исходном SVG — в правильную. Разработчикам стоит закладывать в бюджет не «среднюю цену модели», а разброс стоимости одного запроса в зависимости от уровня рассуждений. Иначе автоагент, переключающийся на max для сложных задач, может превратить $10 в месяц в $300 за вечер — при том что пользователь не увидит разницы между xhigh и max на девяти из десяти запросов. #ClaudeFable #Anthropic #reasoning #инференс