Дайджест недели: главное в ИИ
🧠 Дайджест недели: главное в ИИ
На этой неделе внимание сместилось с громких анонсов на практику: локальное выполнение моделей, метрики качества, безопасность и экономику моделей. Три материала из семи — о том, как модели ведут себя в реальных сценариях, а не в контрольных тестах.
Набор данных из 558 траекторий: вскрыл систематические профили ошибок ИИ-учёных, которые не выявляют стандартные контрольные тесты, — это полезно для проектирования агентов. Но данные собраны в лабораторных условиях, поэтому на промышленную среду переносятся с оговорками.
Разбор DeepSeek R1: техника, деньги и обвал рынка — объясняет, как открытая модель с дешёвым выполнением изменила расклад сил. Полезно для оценки стоимости запуска своих моделей. Ограничение: анализ опирается на открытые данные, реальные затраты на обучение могли быть другими.
Локальные LLM на DGX Spark: 256K контекста — достижимо на локальном оборудовании, но ценой параллельной работы нескольких GPU. Это открывает дорогу к приватному выполнению моделей без облака, однако требует дорогого оборудования и навыков настройки.
GEO-мониторинг своими руками: материал о том, какие метрики снимать с ответов генеративных моделей в промышленной среде, — практично для команд, внедряющих LLM. Универсального набора нет, придётся адаптировать под свою предметную область.
Яндекс открыл Alice AI T5-35B: предобученная модель для быстрых ответов, веса доступны для дообучения. Это заметное событие для русскоязычного ML. Ограничение: базовая модель без инструктивной настройки, для диалогов нужно самостоятельное SFT, и условия лицензии требуют отдельного изучения.
GPT-6 Astra введена в эксплуатацию: заявлен идеальный результат в тесте на устойчивость к эксплойтам, что важно для безопасности. Но методология внутреннего теста не раскрыта, независимая проверка ещё впереди.
Агенты для Blender: программирующие агенты научились генерировать код для визуализации сцен через Python API, это расширяет автоматизацию на 3D-графику. Сложные сцены всё ещё могут нарушать работу генерации, ручная проверка обязательна.
Авторский вывод: Неделя показала смещение внимания с гонки параметров на практическую применимость: мониторинг, локальное выполнение моделей, безопасность. Открытая модель Яндекса и локальные запуски на DGX Spark — сигнал, что выполнение моделей всё чаще уходит на собственное оборудование. Но за «идеальными» тестами и «быстрыми ответами» всегда стоит вопрос: что именно измеряли и на каких данных.
#ИИ #дайджест #нейросети
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.