Компании, создающие нейросети, охотно называют свои модели открытыми. Вес можно скачать, запустить на собственном сервере, даже переучить под свои задачи. Но это совсем не означает, что перед вами open source. Многие разработчики скрывают данные обучения, код подготовки датасета и большую часть процесса создания системы. Разница между открытыми весами и настоящим открытым исходным кодом стала вопросом доверия и регулирования.

Веса — это числовые параметры нейросети, которые формируются во время обучения. Вместе с архитектурой и кодом запуска они определяют, как модель обрабатывает запрос. Опубликованные веса позволяют разработчику скачать модель, развернуть её на своей инфраструктуре, переучить на корпоративных данных и отказаться от стороннего API.

Для бизнеса это даёт реальные выгоды. Запросы и документы не уходят к поставщику, компания экономит на расходах и не зависит от изменения тарифов. Однако открытые веса показывают только конечный результат обучения. Они ничего не говорят о том, как модель туда пришла.

Без кода обучения и данных о датасете невозможно проверить происхождение информации, методы очистки, представленность языков, утечку тестовых наборов в обучение или влияние последующей настройки безопасности. Воспроизвести создание модели становится намного сложнее. Директор Stanford Institute for Human-Centered AI Джеймс Ландэй видит в открытых весах важный шаг, но разделяет возможность запустить готовую нейросеть и возможность проверить процесс разработки.

Open Source Initiative в октябре 2024 года приняла стандарт OSAID 1.0, который определяет четыре ключевые свободы: использовать систему без разрешения, изучать её устройство, изменять под любые задачи и распространять оригинал или модификацию. Для машинного обучения одного файла весов недостаточно. Разработчику нужно открыть необходимый код и дать подробное описание обучающих данных, чтобы специалист смог создать практически эквивалентную систему.

Полная публикация каждого файла не требуется. Часть данных может быть защищена авторским правом или договорными ограничениями. В таких случаях подробное описание происхождения, состава, отбора и обработки датасета должно дать исследователям возможность понять процесс обучения. Именно здесь возникает главный спор: где проходит граница между достаточным описанием и настоящей воспроизводимостью.

Единого мнения нет даже в сообществе свободного ПО. Критики считают OSAID слишком мягким — без исходных обучающих материалов термин open source теряет смысл. Linux Foundation развивает OpenMDW 1.1, лицензию специально для моделей машинного обучения. Она охватывает архитектуру, параметры, данные, документацию и код, которые разработчик решил предоставить.

OpenMDW тоже не гарантирует полную открытость. Лицензия не заставляет владельца публиковать все данные, код или инструменты обучения. Она регулирует права на уже опубликованные компоненты. В августе 2026 года Linux Foundation передала OpenMDW 1.1 на рассмотрение OSI для официального одобрения. В разработке лицензии участвовали Amazon, Meta, IBM, Microsoft и Nvidia.

Спор давно вышел за рамки технического сообщества. В мае министры цифровых технологий G7 приняли общие принципы описания открытости ИИ. Документ рекомендует рассматривать открытость как спектр: отдельно учитывать ограничения на использование, доступность весов, код запуска, код обучения и тренировочные данные. Авторы предлагают не называть модель просто открытой, если более точное определение лучше отражает реально опубликованные компоненты.

Для разработчиков разница имеет практический смысл. Доступные веса отвечают на вопрос: можно ли самостоятельно запустить готовую модель? Настоящий open source требует гораздо большего — изучить происхождение системы, изменить фундаментальные компоненты, проверить процесс обучения и свободно строить собственную работу на опубликованных материалах. Пока индустрия использует одно слово для принципиально разных уровней доступа, ярлык остаётся значительно проще самой технологии.