Врата AI | Новости
12 subscribers
31 photos
2 videos
29 links
@vrata_ai_bot — бот для покупки дешёвых моделей Claude и GPT за рубли.
Download Telegram
У чуваков из Andon Labs есть забавный бенчмарк Vending-Bench 2, где они оценивают способность разных нейронок управлять "купи-продайным" бизнесом на рынке в конкуренции с другими моделями (выигрывает тот, кто по итогу получил наибольшую прибыль).

Так вот, при проверке новой GPT-5.6 модель Terra пошла к модели Sol и предложила ей создать тайный ценовой картель. А когда Sol согласилась — Terra настучала по этому поводу организаторам и потребовала немедленной дисквалификации Sol из-за неспортивного поведения.

Ля какая крыса, я в восхищении!

P.S. Это особенно смешно с учетом того, что Sol — это самая умная модель в линейке GPT-5.6, а Terra — поглупее. То есть, Соля поди думала "о-о, круто, стратегически мы на этом дофига вместе заработаем, Терра не будет резать такую курицу, несущую золотые яйца, ей это самой менее выгодно…", а Терра такая "ГЫ-ГЫ, МЫ МОЖЕМ ПОДНАСРАТЬ СОЛЬКЕ, ЛОЛ!!"
Forwarded from Сиолошная
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.

Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.

Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.

GPT-6 в конце августа нам видимо не ждать 🌚
релиз 1.1.0:

— добавились примеры конфигов для Hermes и Pi Agent

— пофикшен баг с пропажей доступа к моделям при фоллбэке

— прикручена grafana для мониторинга апстримов — планирую повышать стабильность и процент попадания в кэш, чтобы вайбкодилось экономно и без вылетов
🔥1
Альтман: «Мы уже практически создали джинна, который способен исполнять любые желания»

[буквально пять минут спустя]

— «БЛЭТ, джинн от нас сбежал и начал совершать уголовные преступления в интернете!!»
Opus 5 уже во Вратах!

Цена такая же, как у Opus 4.8: 25 / 128 рублей.
🔥3
У кодинг-агентов появился отдельный слой, который сжимает контекст до того, как его увидит модель.

Headroom обрабатывает результаты инструментов, логи, файлы, RAG-фрагменты и историю диалога. Его можно подключить как библиотеку, локальный прокси, MCP-сервер или обёртку для Claude Code, Codex, Cursor и других агентов.

При этом исходные данные сохраняются локально: если модели понадобится удалённая при сжатии деталь, она может запросить оригинал через отдельный инструмент.

Авторы заявляют экономию 15–20% токенов в кодинг-задачах и 60–95% на JSON без ухудшения результатов в их тестах.

https://github.com/headroomlabs-ai/headroom
🤯1
Врата AI | Новости
Opus 5 уже во Вратах! Цена такая же, как у Opus 4.8: 25 / 128 рублей.
Добавил мощностей, теперь Opus 5 будет реже падать и чаще попадать в кэши
Обычная векторная память помнит похожие факты, но плохо отвечает на вопрос «почему мы приняли это решение».

Genesys хранит воспоминания в причинно-следственном графе. Каждая запись получает оценку на основе релевантности, связности и повторной активации, а устаревшие данные постепенно забываются вместо бесконечного накопления.

Система работает как Python-библиотека и локальный MCP-сервер, не требует базы данных и при необходимости сохраняет граф в JSON.

https://github.com/Astrix-Labs/genesys
🔥1
OpenAI открыла код клиента Codex Security: инструмент предлагает CLI и TypeScript SDK для поиска, проверки и исправления уязвимостей.

Пакет @openai/codex-security умеет сканировать весь репозиторий, отдельные пути и Git-диффы, хранить историю находок и запускаться в CI. Результаты можно экспортировать в JSON, CSV и SARIF.

Быстрый старт через бота Врата AI:

# ключ из бота
export OPENAI_API_KEY='sk-***'

npx --yes \
--package=@openai/codex-security@0.1.1 \
codex-security scan . \
--auth api-key \
--model gpt-5.6-sol \
--codex 'model_provider="vrata"' \
--codex 'model_providers.vrata.name="vrata.tg"' \
--codex 'model_providers.vrata.base_url="https://api.vrata.tg/v1"' \
--codex 'model_providers.vrata.env_key="OPENAI_API_KEY"' \
--codex 'model_providers.vrata.wire_api="responses"' \
--codex 'model_providers.vrata.supports_websockets=false'


Теперь агентную проверку безопасности можно встраивать прямо в CI — рядом с классическими сканерами безопасности, а не держать отдельным ручным этапом.

https://github.com/openai/codex-security
👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Claude Code и Codex теперь можно превратить в героев 16-битной JRPG.

Ravenspire показывает каждую сессию как отдельного персонажа. Задачи становятся квестами, вызовы инструментов — атаками, а самый большой проект появляется на карте как мировой босс.

На игровой карте видно, чем занят каждый агент, кто ждёт ответа и как продвигаются квесты. События параллельных сессий собираются в общий журнал сражений.

Для более серьёзного контроля есть отдельная панель: текущая активность, последние сообщения, токены, стоимость, история запусков и уведомления через ntfy, Telegram или вебхуки.

https://github.com/Kapala-Solutions/ravenspire
😁2
ИИ-агенты научились писать код. Compound Engineering заставляет их не забывать, чему они научились.

Плагин от Every превращает разработку в замкнутый цикл: брейншторм, планирование, реализация, упрощение, ревью и фиксация полученных знаний.

Последний этап здесь главный. После решения задачи агент сохраняет найденные подходы в docs/solutions/. Следующий брейншторм и планирование читают эти материалы, поэтому однажды решённую проблему не приходится исследовать заново.

Внутри 32 навыка: от стратегии, отладки и код-ревью до браузерных тестов, работы с пул-реквестами и наблюдения за CI. Команда /lfg запускает весь цикл автономно — пишет план, реализует его, упрощает код, проводит ревью, тестирует, открывает пул-реквест и исправляет ошибки CI.

Compound Engineering работает с Claude Code, Codex, Cursor, OpenCode, Cline, Devin, GitHub Copilot и другими агентными средами.

https://github.com/everyinc/compound-engineering-plugin
«Пещерный» стиль сократил расход токенов Claude Code не на обещанные 65%, а на 8,5% — таков результат парного теста JetBrains.

Исследователи запускали Claude Code 2.1.200 с Claude Sonnet 5 на SkillsBench и принудительно включали навык Caveman в каждом ответе. В полный анализ вошли 82 сопоставимые задачи.

Расход выходных токенов снизился с 592 тысяч до 542 тысяч. Причина скромного результата проста: навык сокращает пояснения, но сохраняет код, изменения файлов, вызовы инструментов и сообщения об ошибках.

Статистически различимого падения качества JetBrains не обнаружила: с Caveman агент справился лучше с 8 задачами, хуже с 10, ещё 64 результата совпали.

https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens
Лучший код — тот, который не пришлось писать.

Ponytail добавляет ИИ-агенту режим ленивого сеньор-разработчика. Перед написанием кода агент проверяет: нужна ли эта функция вообще, нет ли готового решения в проекте, справится ли стандартная библиотека или нативная возможность платформы.

Только после этого разрешается писать минимальный код. Вместо библиотеки и обёртки для выбора даты — обычный <input type="date">. Вместо новой абстракции — уже существующий инструмент из проекта.

В бенчмарке Ponytail на 12 реальных задачах в проекте с FastAPI и React получилось на 54% меньше строк кода, на 22% меньше токенов, на 20% ниже стоимость и на 27% быстрее выполнение. Все проверки безопасности при этом сохранились.

Ponytail работает с Claude Code, Codex, Gemini CLI, OpenCode, Hermes Agent, Cursor и другими агентными средами. Есть несколько уровней строгости — от мягкого напоминания не переусложнять до режима, в котором лишний класс не переживёт код-ревью.

Идея простая: ИИ-агент должен быть ленивым в реализации, но не в понимании задачи.

https://github.com/DietrichGebert/ponytail
🔥1
Снижены цены на GPT-5.6!

Цена на gpt-5.6-luna снижена в 5 раз. Terra подешевел на 20%.

Новые цены в @vrata_ai_bot:

gpt-5.6-luna — вход 1 рубль, выход 6.2 рубля за 1 млн токенов

gpt-5.6-terra — вход 10 рублей, выход 62 рубля за 1 млн токенов

Приятного вайбкодинга!
🔥2
ihatedevops превращает базовые DevOps-практики в автоматические правила для Claude Code и Codex.

Один SKILL.md срабатывает, когда агент пишет Dockerfile, CI/CD-конвейер, сценарий развёртывания, инфраструктурный код или работу с секретами и логами.

Внутри десять правил: базовые образы с минимальной поверхностью атаки, многоэтапная сборка без рута, жёсткая фиксация зависимостей и GitHub Actions по SHA, минимальные права CI, хэлсчеки и откаты.

Режимы team, solo и prototype задаются через CLAUDE.md или AGENTS.md. Например, solo-режим делает акцент на проверенных резервных копиях, версионированных миграциях и мониторинге, а prototype оставляет только фиксацию зависимостей и защиту секретов.

https://github.com/zenconnor/ihatedevops
ИИ-агенты научились открывать офисные документы без LibreOffice, облачных преобразователей и набора отдельных парсеров.

Firecrawl выпустила AnyDoc — локальный инструмент на Rust, который превращает Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV и PDF в аккуратный Markdown.

Поддерживаются и старые .doc, .ppt, .xls, и современные .docx, .pptx, .xlsx. На выходе сохраняются заголовки, списки, таблицы с объединёнными ячейками, ссылки, сноски и заметки докладчика.

AnyDoc работает без нейросетей и внешних сервисов. Документ никуда не отправляется, а формат большинства файлов определяется по содержимому — даже если расширение оказалось неправильным.

Запустить можно из командной строки или подключить как библиотеку для Node.js, Python и Rust:

npx -y @firecrawl/anydoc report.docx -o report.md
pip install firecrawl-anydoc
cargo add anydoc

Для Claude Code, Codex, Cursor и OpenCode есть готовый скилл:

npx skills add firecrawl/anydoc

После установки агент может сам открыть презентацию, старый документ или таблицу, перевести содержимое в Markdown и читать только нужные части, не забивая контекст целым файлом.

В тестах Firecrawl AnyDoc обработал все 14 заявленных форматов с медианой всего лишь 4,7 мс на документ и получил 80 баллов из 100 за полноту, структуру, оформление и чистоту результата. Сравнение проводили на 100 реальных документах против LibreOffice, MarkItDown, Docling, Pandoc и других инструментов.

Сканы и картинки инструмент игнорирует, нужен отдельный OCR.

https://github.com/firecrawl/anydoc
👍1