Forwarded from Самые умные мысли Павла Комаровского (и немножко щитпостинг)
У чуваков из Andon Labs есть забавный бенчмарк Vending-Bench 2, где они оценивают способность разных нейронок управлять "купи-продайным" бизнесом на рынке в конкуренции с другими моделями (выигрывает тот, кто по итогу получил наибольшую прибыль).
Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.
Ля какая крыса, я в восхищении!
P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.
Ля какая крыса, я в восхищении!
P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Forwarded from Сиолошная
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.
Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.
Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.
GPT-6 в конце августа нам видимо не ждать 🌚
Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.
Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.
GPT-6 в конце августа нам видимо не ждать 🌚
релиз 1.1.0:
— добавились примеры конфигов для Hermes и Pi Agent
— пофикшен баг с пропажей доступа к моделям при фоллбэке
— прикручена grafana для мониторинга апстримов — планирую повышать стабильность и процент попадания в кэш, чтобы вайбкодилось экономно и без вылетов
— добавились примеры конфигов для Hermes и Pi Agent
— пофикшен баг с пропажей доступа к моделям при фоллбэке
— прикручена grafana для мониторинга апстримов — планирую повышать стабильность и процент попадания в кэш, чтобы вайбкодилось экономно и без вылетов
🔥1
ожидаем появления у провайдеров, ориентировочно в ближайшие дни
https://www.anthropic.com/news/claude-opus-5
https://www.anthropic.com/news/claude-opus-5
Anthropic
Introducing Claude Opus 5
Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
Forwarded from Самые умные мысли Павла Комаровского (и немножко щитпостинг)
У кодинг-агентов появился отдельный слой, который сжимает контекст до того, как его увидит модель.
Headroom обрабатывает результаты инструментов, логи, файлы, RAG-фрагменты и историю диалога. Его можно подключить как библиотеку, локальный прокси, MCP-сервер или обёртку для Claude Code, Codex, Cursor и других агентов.
При этом исходные данные сохраняются локально: если модели понадобится удалённая при сжатии деталь, она может запросить оригинал через отдельный инструмент.
Авторы заявляют экономию 15–20% токенов в кодинг-задачах и 60–95% на JSON без ухудшения результатов в их тестах.
https://github.com/headroomlabs-ai/headroom
Headroom обрабатывает результаты инструментов, логи, файлы, RAG-фрагменты и историю диалога. Его можно подключить как библиотеку, локальный прокси, MCP-сервер или обёртку для Claude Code, Codex, Cursor и других агентов.
При этом исходные данные сохраняются локально: если модели понадобится удалённая при сжатии деталь, она может запросить оригинал через отдельный инструмент.
Авторы заявляют экономию 15–20% токенов в кодинг-задачах и 60–95% на JSON без ухудшения результатов в их тестах.
https://github.com/headroomlabs-ai/headroom
GitHub
GitHub - headroomlabs-ai/headroom: Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens…
Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server. - headrooml...
🤯1
Врата AI | Новости
Opus 5 уже во Вратах! Цена такая же, как у Opus 4.8: 25 / 128 рублей.
Добавил мощностей, теперь Opus 5 будет реже падать и чаще попадать в кэши
Обычная векторная память помнит похожие факты, но плохо отвечает на вопрос «почему мы приняли это решение».
Genesys хранит воспоминания в причинно-следственном графе. Каждая запись получает оценку на основе релевантности, связности и повторной активации, а устаревшие данные постепенно забываются вместо бесконечного накопления.
Система работает как Python-библиотека и локальный MCP-сервер, не требует базы данных и при необходимости сохраняет граф в JSON.
https://github.com/Astrix-Labs/genesys
Genesys хранит воспоминания в причинно-следственном графе. Каждая запись получает оценку на основе релевантности, связности и повторной активации, а устаревшие данные постепенно забываются вместо бесконечного накопления.
Система работает как Python-библиотека и локальный MCP-сервер, не требует базы данных и при необходимости сохраняет граф в JSON.
https://github.com/Astrix-Labs/genesys
🔥1
OpenAI открыла код клиента Codex Security: инструмент предлагает CLI и TypeScript SDK для поиска, проверки и исправления уязвимостей.
Пакет
Быстрый старт через бота Врата AI:
Теперь агентную проверку безопасности можно встраивать прямо в CI — рядом с классическими сканерами безопасности, а не держать отдельным ручным этапом.
https://github.com/openai/codex-security
Пакет
@openai/codex-security умеет сканировать весь репозиторий, отдельные пути и Git-диффы, хранить историю находок и запускаться в CI. Результаты можно экспортировать в JSON, CSV и SARIF.Быстрый старт через бота Врата AI:
# ключ из бота
export OPENAI_API_KEY='sk-***'
npx --yes \
--package=@openai/codex-security@0.1.1 \
codex-security scan . \
--auth api-key \
--model gpt-5.6-sol \
--codex 'model_provider="vrata"' \
--codex 'model_providers.vrata.name="vrata.tg"' \
--codex 'model_providers.vrata.base_url="https://api.vrata.tg/v1"' \
--codex 'model_providers.vrata.env_key="OPENAI_API_KEY"' \
--codex 'model_providers.vrata.wire_api="responses"' \
--codex 'model_providers.vrata.supports_websockets=false'
Теперь агентную проверку безопасности можно встраивать прямо в CI — рядом с классическими сканерами безопасности, а не держать отдельным ручным этапом.
https://github.com/openai/codex-security
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Claude Code и Codex теперь можно превратить в героев 16-битной JRPG.
Ravenspire показывает каждую сессию как отдельного персонажа. Задачи становятся квестами, вызовы инструментов — атаками, а самый большой проект появляется на карте как мировой босс.
На игровой карте видно, чем занят каждый агент, кто ждёт ответа и как продвигаются квесты. События параллельных сессий собираются в общий журнал сражений.
Для более серьёзного контроля есть отдельная панель: текущая активность, последние сообщения, токены, стоимость, история запусков и уведомления через ntfy, Telegram или вебхуки.
https://github.com/Kapala-Solutions/ravenspire
Ravenspire показывает каждую сессию как отдельного персонажа. Задачи становятся квестами, вызовы инструментов — атаками, а самый большой проект появляется на карте как мировой босс.
На игровой карте видно, чем занят каждый агент, кто ждёт ответа и как продвигаются квесты. События параллельных сессий собираются в общий журнал сражений.
Для более серьёзного контроля есть отдельная панель: текущая активность, последние сообщения, токены, стоимость, история запусков и уведомления через ntfy, Telegram или вебхуки.
https://github.com/Kapala-Solutions/ravenspire
😁2
ИИ-агенты научились писать код. Compound Engineering заставляет их не забывать, чему они научились.
Плагин от Every превращает разработку в замкнутый цикл: брейншторм, планирование, реализация, упрощение, ревью и фиксация полученных знаний.
Последний этап здесь главный. После решения задачи агент сохраняет найденные подходы в
Внутри 32 навыка: от стратегии, отладки и код-ревью до браузерных тестов, работы с пул-реквестами и наблюдения за CI. Команда
Compound Engineering работает с Claude Code, Codex, Cursor, OpenCode, Cline, Devin, GitHub Copilot и другими агентными средами.
https://github.com/everyinc/compound-engineering-plugin
Плагин от Every превращает разработку в замкнутый цикл: брейншторм, планирование, реализация, упрощение, ревью и фиксация полученных знаний.
Последний этап здесь главный. После решения задачи агент сохраняет найденные подходы в
docs/solutions/. Следующий брейншторм и планирование читают эти материалы, поэтому однажды решённую проблему не приходится исследовать заново.Внутри 32 навыка: от стратегии, отладки и код-ревью до браузерных тестов, работы с пул-реквестами и наблюдения за CI. Команда
/lfg запускает весь цикл автономно — пишет план, реализует его, упрощает код, проводит ревью, тестирует, открывает пул-реквест и исправляет ошибки CI.Compound Engineering работает с Claude Code, Codex, Cursor, OpenCode, Cline, Devin, GitHub Copilot и другими агентными средами.
https://github.com/everyinc/compound-engineering-plugin
«Пещерный» стиль сократил расход токенов Claude Code не на обещанные 65%, а на 8,5% — таков результат парного теста JetBrains.
Исследователи запускали Claude Code 2.1.200 с Claude Sonnet 5 на SkillsBench и принудительно включали навык Caveman в каждом ответе. В полный анализ вошли 82 сопоставимые задачи.
Расход выходных токенов снизился с 592 тысяч до 542 тысяч. Причина скромного результата проста: навык сокращает пояснения, но сохраняет код, изменения файлов, вызовы инструментов и сообщения об ошибках.
Статистически различимого падения качества JetBrains не обнаружила: с Caveman агент справился лучше с 8 задачами, хуже с 10, ещё 64 результата совпали.
https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens
Исследователи запускали Claude Code 2.1.200 с Claude Sonnet 5 на SkillsBench и принудительно включали навык Caveman в каждом ответе. В полный анализ вошли 82 сопоставимые задачи.
Расход выходных токенов снизился с 592 тысяч до 542 тысяч. Причина скромного результата проста: навык сокращает пояснения, но сохраняет код, изменения файлов, вызовы инструментов и сообщения об ошибках.
Статистически различимого падения качества JetBrains не обнаружила: с Caveman агент справился лучше с 8 задачами, хуже с 10, ещё 64 результата совпали.
https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens
Лучший код — тот, который не пришлось писать.
Ponytail добавляет ИИ-агенту режим ленивого сеньор-разработчика. Перед написанием кода агент проверяет: нужна ли эта функция вообще, нет ли готового решения в проекте, справится ли стандартная библиотека или нативная возможность платформы.
Только после этого разрешается писать минимальный код. Вместо библиотеки и обёртки для выбора даты — обычный
В бенчмарке Ponytail на 12 реальных задачах в проекте с FastAPI и React получилось на 54% меньше строк кода, на 22% меньше токенов, на 20% ниже стоимость и на 27% быстрее выполнение. Все проверки безопасности при этом сохранились.
Ponytail работает с Claude Code, Codex, Gemini CLI, OpenCode, Hermes Agent, Cursor и другими агентными средами. Есть несколько уровней строгости — от мягкого напоминания не переусложнять до режима, в котором лишний класс не переживёт код-ревью.
Идея простая: ИИ-агент должен быть ленивым в реализации, но не в понимании задачи.
https://github.com/DietrichGebert/ponytail
Ponytail добавляет ИИ-агенту режим ленивого сеньор-разработчика. Перед написанием кода агент проверяет: нужна ли эта функция вообще, нет ли готового решения в проекте, справится ли стандартная библиотека или нативная возможность платформы.
Только после этого разрешается писать минимальный код. Вместо библиотеки и обёртки для выбора даты — обычный
<input type="date">. Вместо новой абстракции — уже существующий инструмент из проекта.В бенчмарке Ponytail на 12 реальных задачах в проекте с FastAPI и React получилось на 54% меньше строк кода, на 22% меньше токенов, на 20% ниже стоимость и на 27% быстрее выполнение. Все проверки безопасности при этом сохранились.
Ponytail работает с Claude Code, Codex, Gemini CLI, OpenCode, Hermes Agent, Cursor и другими агентными средами. Есть несколько уровней строгости — от мягкого напоминания не переусложнять до режима, в котором лишний класс не переживёт код-ревью.
Идея простая: ИИ-агент должен быть ленивым в реализации, но не в понимании задачи.
https://github.com/DietrichGebert/ponytail
🔥1
Снижены цены на GPT-5.6!
Цена на gpt-5.6-luna снижена в 5 раз. Terra подешевел на 20%.
Новые цены в @vrata_ai_bot:
gpt-5.6-luna — вход 1 рубль, выход 6.2 рубля за 1 млн токенов
gpt-5.6-terra — вход 10 рублей, выход 62 рубля за 1 млн токенов
Приятного вайбкодинга!
Цена на gpt-5.6-luna снижена в 5 раз. Terra подешевел на 20%.
Новые цены в @vrata_ai_bot:
gpt-5.6-luna — вход 1 рубль, выход 6.2 рубля за 1 млн токенов
gpt-5.6-terra — вход 10 рублей, выход 62 рубля за 1 млн токенов
Приятного вайбкодинга!
🔥2
ihatedevops превращает базовые DevOps-практики в автоматические правила для Claude Code и Codex.
Один
Внутри десять правил: базовые образы с минимальной поверхностью атаки, многоэтапная сборка без рута, жёсткая фиксация зависимостей и GitHub Actions по SHA, минимальные права CI, хэлсчеки и откаты.
Режимы
https://github.com/zenconnor/ihatedevops
Один
SKILL.md срабатывает, когда агент пишет Dockerfile, CI/CD-конвейер, сценарий развёртывания, инфраструктурный код или работу с секретами и логами.Внутри десять правил: базовые образы с минимальной поверхностью атаки, многоэтапная сборка без рута, жёсткая фиксация зависимостей и GitHub Actions по SHA, минимальные права CI, хэлсчеки и откаты.
Режимы
team, solo и prototype задаются через CLAUDE.md или AGENTS.md. Например, solo-режим делает акцент на проверенных резервных копиях, версионированных миграциях и мониторинге, а prototype оставляет только фиксацию зависимостей и защиту секретов.https://github.com/zenconnor/ihatedevops
ИИ-агенты научились открывать офисные документы без LibreOffice, облачных преобразователей и набора отдельных парсеров.
Firecrawl выпустила AnyDoc — локальный инструмент на Rust, который превращает Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV и PDF в аккуратный Markdown.
Поддерживаются и старые
AnyDoc работает без нейросетей и внешних сервисов. Документ никуда не отправляется, а формат большинства файлов определяется по содержимому — даже если расширение оказалось неправильным.
Запустить можно из командной строки или подключить как библиотеку для Node.js, Python и Rust:
Для Claude Code, Codex, Cursor и OpenCode есть готовый скилл:
После установки агент может сам открыть презентацию, старый документ или таблицу, перевести содержимое в Markdown и читать только нужные части, не забивая контекст целым файлом.
В тестах Firecrawl AnyDoc обработал все 14 заявленных форматов с медианой всего лишь 4,7 мс на документ и получил 80 баллов из 100 за полноту, структуру, оформление и чистоту результата. Сравнение проводили на 100 реальных документах против LibreOffice, MarkItDown, Docling, Pandoc и других инструментов.
Сканы и картинки инструмент игнорирует, нужен отдельный OCR.
https://github.com/firecrawl/anydoc
Firecrawl выпустила AnyDoc — локальный инструмент на Rust, который превращает Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV и PDF в аккуратный Markdown.
Поддерживаются и старые
.doc, .ppt, .xls, и современные .docx, .pptx, .xlsx. На выходе сохраняются заголовки, списки, таблицы с объединёнными ячейками, ссылки, сноски и заметки докладчика.AnyDoc работает без нейросетей и внешних сервисов. Документ никуда не отправляется, а формат большинства файлов определяется по содержимому — даже если расширение оказалось неправильным.
Запустить можно из командной строки или подключить как библиотеку для Node.js, Python и Rust:
npx -y @firecrawl/anydoc report.docx -o report.md
pip install firecrawl-anydoc
cargo add anydoc
Для Claude Code, Codex, Cursor и OpenCode есть готовый скилл:
npx skills add firecrawl/anydoc
После установки агент может сам открыть презентацию, старый документ или таблицу, перевести содержимое в Markdown и читать только нужные части, не забивая контекст целым файлом.
В тестах Firecrawl AnyDoc обработал все 14 заявленных форматов с медианой всего лишь 4,7 мс на документ и получил 80 баллов из 100 за полноту, структуру, оформление и чистоту результата. Сравнение проводили на 100 реальных документах против LibreOffice, MarkItDown, Docling, Pandoc и других инструментов.
Сканы и картинки инструмент игнорирует, нужен отдельный OCR.
https://github.com/firecrawl/anydoc
👍1