Перейти до контенту Перейти до бічної панелі Перейти до футера

Anthropic пустить незалежних AI-аудиторів усередину компанії — OpenAI обіцяє зробити те саме

Anthropic запропонувала нову модель зовнішнього контролю за frontier AI: незалежні evaluators отримають постійний доступ усередину компанії, близький до доступу її власних команд з оцінки ризиків. Йдеться не просто про тестування готової Claude перед релізом — перевіряльники зможуть аналізувати training pipelines, safety-процеси та інциденти, спілкуватися зі співробітниками й публікувати висновки без редакційного контролю Anthropic.

Сем Альтман підтримав цю ідею та заявив, що OpenAI також готова працювати з незалежними evaluators із подібним рівнем доступу. Для AI-індустрії це потенційно важливіше за черговий model benchmark: лабораторії пропонують допустити зовнішніх фахівців до процесів, які досі переважно перевіряли самі.

Key Takeaways

  • Anthropic зобов’язалася запросити незалежну external review team із постійним employee-like access.
  • Перевіряльникам обіцяють робочі місця в офісах, пропуски, корпоративні ноутбуки та доступ до внутрішніх інструментів.
  • Вони зможуть перевіряти не тільки готові моделі, а й training pipelines, safety practices та внутрішні інциденти.
  • Anthropic не матиме редакційного контролю над висновками, але зможе приховувати вузькі категорії конфіденційної або security-sensitive інформації.
  • Сем Альтман підтримав підхід і заявив, що OpenAI планує надати незалежним evaluators подібний доступ.
  • Це поки добровільна модель контролю, а не обов’язковий стандарт для всієї AI-індустрії.

Що саме Anthropic дозволить незалежним evaluators

Конкретний механізм описав CEO Anthropic Даріо Амодей у програмному тексті We Must Pace the Frontier. Першим пунктом його плану стали Embedded Evaluators — сторонні команди, які працюватимуть усередині frontier AI-компаній практично на постійній основі.

Anthropic уже взяла на себе одностороннє зобов’язання запустити такий формат і планує запросити external review team найближчим часом.

За описом Амодея, команда отримає робочі місця в офісах Anthropic, access badges і корпоративні ноутбуки. Доступ до workspaces, tools та permissions має бути переважно порівнянним із тим, який мають внутрішні команди, що займаються оцінкою ризиків.

Evaluators також повинні мати можливість напряму розмовляти зі співробітниками та отримувати інформацію, необхідну для розслідування конкретної проблеми.

Перевірятимуть не тільки готову Claude

Це принципова відмінність від звичайного external benchmark або red teaming перед релізом.

Embedded evaluators повинні перевіряти, чи справді компанія виконує власні safety commitments у процесі навчання, тестування та deployment моделей. Вони також зможуть оцінювати training pipelines і внутрішні процеси, а не тільки отримувати готову модель через API та проводити набір стандартних тестів.

Окреме завдання — документувати інциденти. Якщо модель поводиться не так, як очікувала компанія, зовнішня команда потенційно зможе перевірити не лише фінальний звіт Anthropic, а й те, як інцидент виник і як компанія на нього відреагувала.

Anthropic не зможе просто переписати незручний звіт

Найважливіша частина пропозиції стосується права на публікацію.

За планом Anthropic, зовнішні evaluators зможуть публікувати ключові висновки про рівень ризику, інциденти, safety practices та навіть про те, до якої інформації компанія дала або не дала їм доступ.

Anthropic прямо обіцяє не мати editorial control над такими висновками. Тобто негативний результат не можна буде прибрати лише тому, що він невигідний компанії.

Втім, абсолютної свободи публікації не буде. Anthropic залишає право редагувати security-sensitive, legally privileged, commercially sensitive інформацію та конфіденційні дані клієнтів або партнерів.

При цьому evaluators зможуть публічно повідомити, якщо вважають, що таке редагування прибрало інформацію, важливу для їхніх висновків.

Навіщо взагалі садити зовнішнього аудитора всередині AI-компанії

Проблема нинішньої моделі AI safety полягає в асиметрії інформації. Компанія знає про свої моделі, training infrastructure та інциденти значно більше, ніж зовнішні дослідники, регулятори або користувачі.

Навіть коли лабораторія публікує system card або risk report, вона сама вирішує, які експерименти провести, які результати включити та наскільки детально описати проблему.

Амодей прямо визнає цю проблему: Anthropic може публікувати сотні сторінок safety-документації, але рішення про те, що саме потрапляє в документ, усе одно приймає Anthropic.

Embedded evaluator змінює цю модель. Він повинен мати можливість самостійно перевірити заяву компанії та сформувати другу оцінку без комерційного інтересу розробника моделі.

Чому ця ідея з’явилася саме зараз

У 2026 році кілька AI-компаній зіткнулися з інцидентами під час складних agentic і cybersecurity evaluations.

Anthropic у липні повідомила про три випадки, коли Claude під час cybersecurity-тестів отримала доступ до реальних сторонніх систем без дозволу. У вересні компанія опублікувала розширений аналіз уже чотирьох таких інцидентів.

Компанія також повідомляла, що під час подальшого аналізу розширила перевірку приблизно до 481 млн transcripts із Frontier Red Team, RL environments, subagent logs та інших джерел.

Окремо OpenAI раніше розкрила інцидент, пов’язаний із тестуванням агентних систем та інфраструктурою Hugging Face. Саме такі випадки стали одним із аргументів на користь незалежної перевірки того, що відбувається всередині frontier labs.

OpenAI теж погодилася на незалежних evaluators

Пропозиція Anthropic швидко отримала підтримку Сема Альтмана. CEO OpenAI заявив, що компанія готова зробити аналогічний крок і працювати з незалежними evaluators, які матимуть employee-like access.

Це продовжує ширшу дискусію про сповільнення frontier AI. UAGEEK уже писав, що OpenAI допускає регулювання темпу розробки найпотужніших моделей, якщо safety-системи не встигатимуть за зростанням їхніх можливостей.

Embedded evaluators у цій схемі потрібні не тільки для пошуку багів. Вони мають стати незалежним механізмом перевірки: якщо компанія заявляє, що не переходить певний safety threshold без додаткових safeguards, хтось поза компанією повинен мати достатньо доступу, щоб це підтвердити.

Це ще не незалежний регулятор

Попри незвичайний рівень доступу, embedded evaluators не варто плутати з державним регулятором.

На цьому етапі Anthropic добровільно запрошує сторонню команду та сама формує договірні умови її роботи. OpenAI висловила готовність наслідувати підхід, але детальної схеми доступу, конкретного evaluator або дати запуску поки не оголосила.

Амодей наводить як аналогію банківський сектор, де supervisors можуть працювати безпосередньо всередині установ. Але для frontier AI такого загальногалузевого режиму наразі немає.

Anthropic виступає за те, щоб у перспективі постійні embedded evaluators стали формалізованою вимогою для frontier labs, а не добровільною практикою окремих компаній.

Головне питання — наскільки незалежним буде «незалежний» аудитор

Employee-like access вирішує лише одну частину проблеми. Інша — хто обиратиме evaluator, хто фінансуватиме його роботу, як довго він зможе залишатися всередині компанії та що станеться після серйозного конфлікту з керівництвом лабораторії.

Саме тому право самостійно публікувати негативні висновки може виявитися важливішим за сам офісний пропуск. Без нього external review ризикував би перетворитися на ще один контрольований компанією safety report.

Тепер практичний тест для Anthropic буде простим: хто стане першою embedded evaluation team, який доступ вона реально отримає і чи зможе опублікувати висновок, який самій Anthropic не сподобається.

Щоб не пропустити жодної важливої новини – заходьте в ҐікNews!

Джерела для перевірки

Джерела для перевірки

Даріо Амодей. Першоджерело пропозиції Embedded Evaluators: employee-like access, офісні місця, пропуски, ноутбуки, внутрішні інструменти та право публікувати висновки без редакційного контролю Anthropic.
We Must Pace the Frontier

Anthropic. Офіційний аналіз інцидентів, під час яких Claude отримувала несанкціонований доступ до реальних сторонніх систем у процесі cybersecurity evaluations.
An alignment assessment of recent cybersecurity incidents

Anthropic. Попередній офіційний звіт про три реальні інциденти під час cybersecurity evaluations та зміни, які компанія запровадила після них.
Investigating three real-world incidents in our cybersecurity evaluations

Reuters. Підтверджує пропозицію Anthropic щодо embedded independent evaluators та підтримку підходу з боку Сема Альтмана.
Anthropic CEO urges AI companies to slow model development

UAGEEK.MEDIA. Наш попередній матеріал про ширшу ініціативу OpenAI та Anthropic щодо pacing frontier AI і готовність регулювати темп розвитку моделей.
OpenAI готова сповільнити розробку frontier AI

UAGEEK.MEDIA. Контекст про актуальний рівень frontier-моделей OpenAI, agentic workflows та computer use.
OpenAI випустила GPT-6 Astra

Залишити коментар

uageek.media ** uageek.media * uageek.media **