● HABR WEEKLY DIGEST · AI / AGENTS / LLM

AI-статьи недели с Хабра

Разборы, рецепты и инструменты по LLM и агентам, которые можно применить: о чём статья — что главное — что попробовать за вечер.

🗓 окно 2026-09-14 — 2026-09-21 ⚡ статей: 8 👀 на заметку: 4 📡 отсканировано: 282
📝 О чём пишут на этой неделе

На этой неделе авторы Хабра окончательно перешли от восхищения демо-роликами к суровой оптимизации агентного рантайма и контекста. Инженеры переписывают статические графы LangGraph на динамические библиотеки ради экономии половины токенов, подключают AST-анализаторы монорепозиториев по MCP и выявляют ловушки наивного ReAct-вызова локальных моделей. Главный практический сдвиг — отказ от общих запретов в системных инструкциях в пользу алгоритмических чек-листов и жестких ratchet-гейтов в CI, предотвращающих регрессии автокодинга.

Главные статьи недели

01

gMAS: как мы переписали рантайм LangGraph на rustworkx для динамических графов агентов

✍ Sber Хабр ⏱ ≈17 мин AI-агенты Python LangGraph
О чём

Разработчики Sber AI Lab столкнулись с ограничением LangGraph: его граф компилируется статически и не позволяет перестраивать связи агентов во время выполнения. В ответ они создали открытый фреймворк gMAS на базе графовой библиотеки rustworkx, где топология адаптируется на лету без перезапуска сессии.

🔑 Главное
  • Поддерживаются три уровня динамики: маршрутизация, переключение связей между агентами и создание новых узлов прямо в рантайме.
  • Механизм досрочной остановки тупиковых веток снизил расход токенов на 52,6%, а обучаемое прореживание графа — на 27% (исследование на бенчмарках Big-Bench Hard, GSM8k и MMLU-Pro).
  • Вычисления отделены от структуры: граф компилируется в плоские структуры rustworkx, обеспечивая накладные расходы планировщика менее 1 мс на шаг.
  • Библиотека опубликована на PyPI под именем frontier-ai-gmas и включает веб-интерфейс flowMAS для визуальной трассировки агентов.
⚡ Попробовать за вечер
  • Установить пакет через pip install frontier-ai-gmas и собрать динамический граф через класс gmas.GraphBuilder.
  • Запустить бенчмарк прореживания: uv run python -m benchmarks.topology.run --datasets gsm8k --max-samples 20.
  • Метрика: экономия свыше 30% входных токенов при решении многошаговых задач за счёт динамического отключения лишних субагентов.
Архитектура gMAS и Trace Explorer из статьи
На схеме: архитектура gMAS — редактор flowMAS Studio, исполняемый граф ролей и Trace Explorer с отслеживанием топологии в реальном времени.
02

TeaRAGs: Codebase Intelligence для Claude Code на монолите в 3,5 млн строк

✍ art2rik Хабр ⏱ ≈44 мин Codebase Intelligence MCP Claude Code
О чём

Кодинг-агенты забивают контекст слепым чтением файлов через grep и теряют связь в проектах крупнее 100 тысяч строк. Автор построил TeaRAGs — локальный сервер по протоколу MCP, объединяющий AST-граф вызовов, Git-топологию хотспотов и семантический поиск для локализации багов за 40 секунд.

🔑 Главное
  • Индексация монолита на 3,5 млн строк занимает менее 3 минут благодаря стриминговому алгоритму Тарьяна и PageRank с лимитом памяти 2 ГБ.
  • Процессные метрики Git (частота правок, churn, число контрибьюторов) предсказывают дефекты с точностью 95%, тогда как метрики стиля кода — лишь на 54%.
  • Инструмент передаёт агенту только 10–15 точечных сигналов вместо тысяч строк сырого кода, снижая расход входных токенов на 85%.
  • Полностью локальный стек: AST-парсеры tree-sitter, база DuckDB и векторное хранилище Qdrant без передачи кода во внешние облака.
⚡ Попробовать за вечер
  • Склонировать проект github.com/artk0de/TeaRAGs-MCP и подключить сервер к Claude Code или Cursor через MCP-манифест.
  • Запустить индексацию своей кодовой базы командой tearags index --path . --workers 8.
  • Протестировать локализацию бага через вызов инструмента mcp__tea-rags__hybrid_search с параметром rerank: "bugHunt".
  • Метрика: сокращение времени поиска корня ошибки агентом с 10 минут слепого перебора до менее 1 минуты.
Диаграмма конвейера индексации TeaRAGs из статьи
На диаграмме: конвейер индексации TeaRAGs — CPU-задачи (парсеры, Git-история и граф) выполняются параллельно в тени непрерывного расчета эмбеддингов на GPU.
03

RAG для юридических документов: гибридный поиск BM25 + BGE-M3 и детерминированная валидация

✍ OlegMos Хабр ⏱ ≈9 мин RAG LegalTech Поиск
О чём

Стандартный векторный RAG на договорах фатально ошибается: теряет номера пунктов, даты и галлюцинирует ставками неустойки. Автор подробно разбирает архитектуру промышленного пайплайна для проверки соглашений аренды, объединившего гибридный поиск со строгим вычислением на Python.

🔑 Главное
  • Гибридный поиск: BM25 находит точные номера статей и реквизиты, а модель BGE-M3 — контекстный смысл; слияние через Reciprocal Rank Fusion (RRF) обеспечило Recall@10 = 0,935 на 401 документе.
  • Cross-encoder реранкер провалился: он снизил Recall@10 до 0,806 и добавил 2,45 с задержки, поэтому от него полностью отказались.
  • Детерминированная маршрутизация: фактографические запросы идут в SQL, смысловые — в RAG; классификатор показал 21 из 21 попадания на регрессионном тесте.
  • LLM извлекает только сырые сущности в валидируемый JSON, а расчет неустоек выполняет верифицированный код без риска галлюцинаций.
⚡ Попробовать за вечер
  • Реализовать слияние выдачи rank_bm25 и dense-векторов BAAI/bge-m3 по формуле Reciprocal Rank Fusion.
  • Вынести логические и числовые расчёты из системного промпта модели в Pydantic-схему с валидатором значений.
  • Метрика: стопроцентная точность числовых расчётов и Recall@10 не ниже 0,90 на выборке сложных договоров.
Схема гибридного поиска BM25 и BGE-M3 из статьи
На схеме: архитектура гибридного RAG — разделение запроса на лексическую и семантическую ветки со слиянием по позициям в выдаче (RRF).
04

Локальный кодинг на 16 ГБ VRAM: почему Unsloth UD-IQ3_XXS обошёл стандартные кванты в OpenCode

✍ lebedkin_lab Хабр ⏱ ≈10 мин Локальные LLM VRAM OpenCode
О чём

Автор провёл строгое тестирование локальных моделей для программирования под 16 ГБ видеопамяти (RTX 5060 Ti) в связке с кодинг-агентом OpenCode. В статье раскрыта ловушка стандартных квантов и найден точный рецепт запуска 30B-модели без вылета в своп.

🔑 Главное
  • Ловушка длины контекста: на 16K токенов модель выдаёт 63,8 т/с, но при росте окна до 32K скорость стандартного кванта Q3_K_M падает в 40 раз (до 1,57 т/с) из-за нехватки VRAM под KV-кэш.
  • Победа квантования Unsloth: файл UD-IQ3_XXS для Qwen3-Coder-30B показал скорость 42,3 т/с и освободил на 872 МБ больше памяти (1517 МБ против 645 МБ), сохранив стабильный отклик.
  • Проверка тулинга: модели Qwen2.5-14B и REAP-25B засыпались на вызове инструментов и создании файлов, тогда как 30B корректно управляла структурой проекта.
⚡ Попробовать за вечер
  • Скачать квантованный вес Qwen3-Coder-30B-A3B-Instruct-UD-IQ3_XXS.gguf.
  • Запустить инференс через команду: llama-server.exe -m model.gguf -c 32768 -ngl 99 --flash-attn.
  • Подключить локальный эндпоинт к OpenCode или Cline и замерить скорость на генерации модуля.
  • Метрика: стабильная скорость выше 40 токенов/с на контексте 32K без сброса слоёв в оперативную память.
05

Локальная Gemma в Codex через MCP: почему попытка сэкономить лимит удвоила расход токенов

✍ crymans Хабр ⏱ ≈6 мин MCP Codex Ollama
О чём

Поучительный разбор архитектурного антипаттерна: автор попытался снизить затраты на облачный Codex, подключив через MCP локальную модель Gemma 3 в Ollama для рутинных ответов. Эксперимент показал, что расход входных токенов при этом вырос более чем в два раза.

🔑 Главное
  • Специфика ReAct-цикла: облачный Codex тратит токены на анализ промпта и вызов тула (14 309 токенов), затем передаёт задачу в MCP, а после ответа Gemma получает весь контекст обратно (ещё 15 000 токенов) для финального ответа.
  • Итоги замера: прямой запрос к Codex отработал за 8,8 с и 14 309 токенов; через MCP цепочка потребовала 21,4 с и 29 301 токен (+105% к расходу).
  • Архитектурный вывод: подключать локальные LLM «снизу» (как инструмент агента) невыгодно. Локальная модель должна стоять «сверху» как внешний роутер, отсекая простые запросы до запуска агента.
⚡ Попробовать за вечер
  • Проверить лог вызовов своего агента на наличие паразитных тулов, возвращающих неизменный контекст.
  • Исключить вторичные генеративные модели из списка инструментов агента.
  • Настроить прокси-роутер перед агентом, отсекающий тривиальные запросы до формирования тяжелого промпта.
  • Метрика: отсутствие повторной пересылки системного контекста при выполнении простых служебных команд.
Сравнение прямого запроса и вызова через MCP из статьи
На схеме: почему MCP не сэкономил лимит — один прямой облачный проход против двух последовательных облачных проходов вокруг локального инструмента.
06

«Агент тупит» — это диагноз инструкции: опыт 2500 пулл-реквестов с Claude Code

✍ e_nikitin Хабр ⏱ ≈12 мин Claude Code Промптинг CI/CD
О чём

Команда low-code платформы Интеграм за год работы доверила ИИ-агенту написание почти всего кода в монорепозитории (2583 смерженных PR). Автор раскладывает типичные сбои агентов на конкретные дефекты инструкций и формулирует правила их оформления в CLAUDE.md.

🔑 Главное
  • Отказ от запретов: фразы «не делай X» не работают, так как не дают альтернативы; вместо этого прописывается прямой чек-лист из 4 вопросов выбора нужного паттерна.
  • Иерархия источников правды: ТЗ и тикет нормативны, существующий код — описателен; ориентация на старый код заставляет агента тиражировать костыли.
  • Ratchet-гейты в CI: агенты склонны молча подгонять упавшие тесты под фикс; CI обязан требовать отчет «гейт: N файлов, 0 падений» и жестко блокировать правку эталонных тестов.
  • Сетевая изоляция: в инструкцию вшит запрет обращений к локальным подсетям (127.0.0.1, 192.168.*) и метаданным облака (169.254.169.254).
⚡ Попробовать за вечер
  • Переписать CLAUDE.md или .cursorrules: убрать частицы «не» и заменить их пошаговыми алгоритмами выбора.
  • Добавить в pre-commit хук проверку контрольной суммы файлов с эталонными тестами.
  • Внести список запрещенных IP-диапазонов в системный промпт проекта.
  • Метрика: полное отсутствие рецидивов по уже исправленным архитектурным ошибкам.
Сравнение запретов и чек-листов инструкций из статьи
На схеме: наглядная разница между запретом «как НЕ надо» и прямым пошаговым чек-листом «как надо», исполняемым агентом без двусмысленности.
07

Персональный AI-ассистент на двух RTX 4070 Ti: RAG, Neo4j и замеры инференса 27B-моделей

✍ Serge_Kernbach Хабр ⏱ ≈11 мин Домашний сервер Инференс Neo4j
О чём

Практический отчет о сборке домашней рабочей станции для автономного ассистента на двух видеокартах по 12 ГБ (суммарно 24 ГБ VRAM, PCIe 4.0 x8/x8). Система объединяет языковую модель с векторным поиском LanceDB, графовой памятью Neo4j и голосовым интерфейсом.

🔑 Главное
  • Сравнение рантаймов: LM Studio показала двукратное превосходство над Ollama на модели Qwen3.8-27B-Q4_0 — 58,4 т/с против 27,3 т/с благодаря более быстрому распределению слоёв.
  • Реальный лимит VRAM: при 22 ГБ свободной памяти порог загрузки без вылета в системную RAM проходит на уровне 19,5 ГБ (остаток уходит под KV-кэш и буферы).
  • Графовая память: комбинация LanceDB для поиска фрагментов и Neo4j через MCP-сервер позволяет связывать факты о проектах в структурированный граф.
⚡ Попробовать за вечер
  • Настроить параллельный запуск модели на двух GPU через мульти-GPU профиль в LM Studio или флаги тензорного параллелизма в llama.cpp.
  • Поднять локальный контейнер Neo4j и подключить MCP-сервер графовой памяти к своему ассистенту.
  • Метрика: скорость инференса 27B-моделей не ниже 50 токенов/с при полном отсутствии свопа в системную память.
Сборка с двумя видеокартами RTX 4070 Ti из статьи
На фотографии: рабочая станция с двумя видеокартами RTX 4070 Ti/Super, обеспечивающими 24 ГБ VRAM для запуска 27B–32B моделей.
08

Gnomish Factory: автономный конвейер разработки на Claude Code и OpenSpec с эскалацией блокеров

✍ oinsio Хабр ⏱ ≈5 мин Автономная разработка Claude Code OpenSpec
О чём

Когда базовая работа с кодинг-агентами отлажена, узким местом становится дежурство разработчика у терминала. Автор представил открытую фабрику Gnomish Factory, где агенты автономно берут тикеты, проектируют изменения по спецификациям OpenSpec и зовут человека только при возникновении блокеров.

🔑 Главное
  • Процессная модель IDEF0/ICOM: стадии разработки описаны в stage.yaml и pipeline.yaml с жестко заданными входами, выходами и валидаторами.
  • Фазовый цикл OpenSpec: агент проходит этапы исследования кодовой базы (/opsx:explore), подготовки предложений (/opsx:propose) и пошагового применения (/opsx:apply-sequential).
  • Парковка задач: при неоднозначности в требованиях агент переводит тикет в статус gnomish:needs-human, прикладывает лог и сразу берёт следующую задачу, не простаивая.
⚡ Попробовать за вечер
  • Склонировать репозитории github.com/oinsio/gnomish-factory и тестовый стенд github.com/oinsio/gf-tests.
  • Настроить запуск агента Claude Code в пакетном режиме над репозиторием.
  • Метрика: автономное создание pull request по тикету без ручного вмешательства на промежуточных фазах.
Архитектура Gnomish Factory из статьи
На схеме: архитектура Gnomish Factory — порты и адаптеры для интеграции с трекерами задач, Git-подпроцессами и песочницами Docker.
💬

На что обратить внимание

Материалы и подходы недели, которые полезно держать в поле зрения, но в законченный рецепт для запуска за один вечер они пока не складываются.

🛰 Сжатие контекста в сессиях кодинг-агентов

✍ jon4pХабр⏱ ≈8 мин

Архитектурные приёмы сокращения расхода токенов: скелет сессии, сворачивание закрытых тупиковых веток и динамическая подгрузка схем инструментов по требованию.

Читать ↗

🛰 Обучение ультракомпактной VLM меньше 1 млрд параметров

✍ kmoseenkХабр⏱ ≈12 мин

Опыт сборки компактной мультимодальной модели на базе InternViT-300M и Baguettotron: эффективный трюк pixel unshuffle и анализ деградации этапа рассуждений.

Читать ↗

🛰 Домашний сервер для LLM на платах Tesla V100 SXM2

✍ Lexus08Хабр⏱ ≈10 мин

Экономический расчёт домашней сборки с 32 ГБ быстрой памяти HBM2 по цене $150 за модуль, сложности с охлаждением и тонкости сборки PyTorch под архитектуру Volta.

Читать ↗

🛰 Организация персональной базы знаний под AI-агентов

✍ jtprogruХабр⏱ ≈13 мин

Критический разбор концепции LLM-wiki Андрея Карпатого на базе 6000 заметок в Obsidian: типизированный frontmatter и ритуалы сохранения человеческой памяти.

Читать ↗
🎯

Мой план на эту неделю

Три конкретных действия из выпусков этой недели, которые я внедрю в свой рабочий процесс.

Сделать: переписать CLAUDE.md по методике Интеграм — заменить негативные запреты на позитивные чек-листы и изолировать локальные IP-диапазоны.
до среды
Сделать: скачать квантование UD-IQ3_XXS для Qwen3-Coder-30B и протестировать стабильность генерации на контексте 32K в OpenCode.
до четверга
Сделать: подключить TeaRAGs-MCP к основному рабочему монорепозиторию и оценить точность поиска корня багов по AST-графу.
до субботы
#

Метаданные

сгенерировано 2026-09-21T07:12:00+03:00
окно 2026-09-14 — 2026-09-21 (7 дней)
отсканировано / в дайджест 282 / 12 (8 карточек + 4 на заметку)
источник Habr API (хабы: artificial_intelligence, machine_learning, natural_language_processing, top_weekly)
пропущенные фиды нет (все фиды прочитаны со статусом ok)
×
Открыть статью