Компания NVIDIA выпустила открытый фреймворк NOOA (Object-Oriented Agents), который призван решить проблему фрагментации в разработке ИИ-агентов. Платформа объединяет разрозненные элементы инфраструктуры — шаблоны промптов, схемы инструментов, функции обратного вызова (callbacks) и графы рабочих процессов — в единый класс Python.
Проект передан в консорциум Open Secure AI Alliance для совместного развития открытых стандартов безопасности в сфере искусственного интеллекта.
Архитектурный подход: агент как объект Python
В основе концепции NOOA лежит представление ИИ-агента как стандартного объекта Python, где компоненты транслируются напрямую в элементы объектно-ориентированного программирования:
- методы определяют возможности и доступные действия агента,
- поля класса хранят его текущее состояние,
- строки документации (docstrings) выполняют роль промптов,
- аннотации типов выступают в качестве строгих контрактов для ввода и вывода данных.
from nooa import Agent
# Агент представляет собой объект Python.
class SupportAgent(Agent):
"""You are a support agent."""
# Состояние хранится прямо в объекте. Поля типизированы.
order_db: OrderDB
# Обычный метод — стандартный детерминированный код на Python.
def is_refund_eligible(self, order: Order) -> bool:
return order.delivered and order.days_since_delivery Ticket:
"""Create a typed support ticket."""
...
Ключевой особенностью синтаксиса является разделение логики на вероятностную и детерминированную непосредственно на уровне исходного кода. Метод, тело которого состоит только из многоточия (…), при вызове передается на выполнение языковой модели. Среда выполнения направляет аргументы и контекст вызова в LLM-цикл, который решает задачу и возвращает результат в заданном формате.
Метод с обычным телом выполняется как стандартный детерминированный код на Python. Такой подход упрощает отладку, рефакторинг и тестирование поведения агентов с использованием привычных инструментов контроля версий и CI/CD.
Результаты тестирования на бенчмарках
Разработчики утверждают, что архитектура обвязки (harness) существенно влияет на эффективность работы модели. NVIDIA опубликовала результаты тестирования NOOA на нескольких ключевых бенчмарках:
- SWE-bench Verified: в связке с GPT-5.5 фреймворк достиг точности 82,2%, совершив в среднем 28 вызовов LLM и затратив около 1,1 млн токенов на задачу. Для сравнения, решение PI продемонстрировало точность 78,2%, но при этом потребовало больше ресурсов — 2,2 млн токенов. Фреймворк OpenCode показал близкое к NOOA число запросов и точность 78,6%, однако расход токенов также оказался выше — 1,3 млн на задачу. Таким образом, NOOA демонстрирует потенциал задать новую планку соотношения стоимости и качества.
- CyberGym L1 (тест на повторное обнаружение уязвимостей): успешное решение 86,8% задач при работе с GPT-5.5.
- ARC-AGI-3 (оценка общего логического мышления): средний показатель RHAE составил 50,2%.
- Фреймворк также прошел валидацию на бенчмарке Terminal-Bench 2.0.
Безопасность и ограничения решения
Поскольку модель в рамках NOOA действует через генерацию и непосредственное исполнение кода в интерактивной среде (code as action), запуск агентов требует жесткой изоляции.
NVIDIA настоятельно рекомендует развертывать агентов внутри защищенной среды выполнения NVIDIA OpenShell или в изолированных контейнерах и виртуальных машинах, поскольку внутренние статические валидаторы кода (AST-проверки и черные списки модулей) служат лишь базовой защитой от ошибок, но не предотвращают намеренный обход ограничений.
Заключение
Несмотря на преимущество консолидации логики по сравнению с разрозненными графами в LangGraph или AutoGen, эксперты указывают на несколько технологических компромиссов:
- Сложность аудита кода: методы с … сложно подвергнуть классическому статическому аудиту безопасности (например, через git diff перед слиянием веток), так как их фактическое исполнение генерируется в процессе и зависит от вероятностного поведения модели в среде выполнения.
- Риски инъекций: концепция централизованного описания логики увеличивает потенциальный масштаб ущерба («blast radius») при успешной атаке типа prompt injection, так как злоумышленник может получить более широкий доступ к состоянию и возможностям системы.
- Ограниченность бенчмарков: высокие показатели на SWE-bench или ARC-AGI-3 могут не переноситься напрямую на реальные регулируемые системы. В отличие от тестовых сред с готовыми автоматическими проверками, в реальном продакшене зачастую невозможно мгновенно определить корректность принятого агентом решения.