Публикация была переведена автоматически. Исходный язык: Русский
Представим команду за неделю до раунда. Продукт работает: открытая модель, дообученная на собственных данных поддержки, закрывает заявки быстрее людей. В презентации есть слайд «Proprietary AI model». Инвестор читает его и задаёт один вопрос: что именно здесь ваше?
Дальше обычно наступает пауза. Не потому, что команда что-то скрывает. Потому, что слово «модель» в этом вопросе означает не одну вещь, а стопку разных, и права на каждую живут по своим правилам.
Я разбирала, как оформляют права на модели крупные AI-компании: публичное описание соглашения OpenAI и Microsoft, руководства WIPO по охране AI-систем, тексты лицензий от Apache 2.0 до Llama Community License, патентные реестры. Исследовательский вопрос простой: что именно принадлежит компании, когда ей «принадлежит модель»?
Чем меньше компания, тем быстрее этот вопрос приходит к ней снаружи: от инвестора, enterprise-заказчика или площадки, на которую она выходит.
Даже владельцы фронтир-моделей не считают модель одним активом
В публичном описании соглашения OpenAI и Microsoft отдельными позициями названы конфиденциальные методы исследований, архитектура модели, веса, inference-код и код дообучения. Отдельные строки. Отдельные права.
Это не юридическая педантичность. WIPO разводит те же режимы: авторское право в ML-системах защищает прежде всего код, модель в широком смысле держится комбинацией авторского права, патентов и коммерческой тайны, а веса и параметры приведены как пример информации, которую охраняют режимом конфиденциальности.
Если так считают те, у кого моделей больше всего, фразу «это наша модель» стоит разобрать на части раньше, чем это сделает чужой юрист.
Разложите модель на слои
| Слой | Что это | Чем охраняется |
| Архитектура и методы | Устройство сети, способы обучения и инференса | Патент (где выполнимы условия), секрет, осознанная публикация |
| Исходный код | Код обучения, inference, SDK, safety-инструменты | Авторское право, секрет, лицензии |
| Веса и чекпойнты | Численные параметры, состояния модели, адаптеры | Тайна, контроль доступа, договор; статус в авторском праве не определён |
| Рецепт обучения | Состав и пропорции данных, гиперпараметры, синтетика | Почти целиком тайна |
| Данные и evals | Обучающие наборы, разметка, бенчмарки, red-team наборы | Договоры, лицензии, тайна |
| Alignment и промпты | Reward-модели, правила безопасности, системные промпты, skills | Авторское право на текст и код, секрет, лицензии |
| Инфраструктура и API | Сервинг, протоколы, SDK | Патенты, авторское право, открытые лицензии |
| Бренд | Имена моделей, знаки совместимости | Товарные знаки, правила экосистемы |
Авторское право здесь охраняет конкретное выражение: написанный код, текст, документацию. Метод оно не охраняет: WIPO прямо описывает возможность законно воспроизвести ту же функциональность другим кодом. Поэтому один слой без остальных почти ничего не гарантирует.
Из таблицы следует неудобное правило. Нельзя владеть моделью сильнее, чем вы владеете каждым её слоем.
Эта строка выглядит банальной ровно до первого due diligence.
Считайте веса тайной, а не произведением
Веса — самый ценный файл в компании и самое слабое место всей конструкции «наша модель».
Есть ли у весов автор? Есть ли оригинальность? Считать ли копией независимо обученный дубль, который ведёт себя почти так же? Единого мирового ответа на эти вопросы нет.
Поэтому закрытые компании на практике охраняют веса не как произведение, а как тайну: ограничение доступа, договорные запреты, физическое неотчуждение файла. Модель продаётся через API, и API здесь — не способ доставки, а архитектура ограждения: пользователь получает результат, но не получает веса, код, рецепт и внутреннюю маршрутизацию.
Самый ценный файл — с самым неясным правовым статусом. Это не парадокс, это устройство отрасли.
Прочитайте лицензию под своим fine-tune
Теперь главный для практики слой. Команда дообучила открытую модель и называет результат своим. Юридически там появляется слоёное владение: базовые веса живут по условиям upstream-лицензии, новые адаптеры и дельта-веса могут принадлежать разработчику, данные используются на своих основаниях, имя модели упирается в товарные знаки.
И лицензии дают очень разные ответы.
Apache 2.0 — широкие права на использование, изменение и коммерческое распространение, плюс отдельная патентная оговорка. Llama 4 Community License — собственные условия Meta: политика допустимого использования включена в договор, порог по аудитории для крупных сервисов, требования к наименованию производных. Условия Gemma идут дальше: понятие Model Derivatives охватывает и модели, созданные переносом паттернов через выводы — дистилляцией или синтетическими данными — с намерением повторить поведение Gemma; при этом сами выводы производными не считаются. DeepSeek-R1 распространяется под MIT с прямым разрешением дистилляции, но дистиллированные варианты наследуют лицензии базовых Qwen и Llama.
Что ваша лицензия говорит про производные? Про дистилляцию? Про коммерческое использование? Про имя? Про использование выводов для обучения другой модели?
Ответ «мы дообучили, значит наше» не выдерживает первого чтения лицензии.
Не принимайте открытые веса за open source
На рынке постоянно смешивают несколько разных режимов. Проприетарная модель за API: доступ есть, весов и кода нет. Open-weight: веса можно скачать, но данные не раскрыты, код может отсутствовать, а лицензия — содержать ограничения. Source-available: часть кода показана, но без свобод открытой лицензии. Open source AI в строгом смысле: определение OSI требует для модифицируемости не только параметры, но и код, и достаточно подробную информацию о данных. И открытый стандарт: открыт интерфейс, а реализации и модели вокруг него могут быть закрыты.
«Компания открытая» — почти пустое утверждение, пока не названы три вещи: что именно открыто, под какой лицензией, с какими ограничениями.
Соберите пять ответов до чужого кабинета
Фраза «наша модель» раскладывается на пять вопросов:
Чья архитектура? Чей код обучения? Чьи веса — и что написано в лицензии базовой модели? Чьи данные — и на каком основании они попали в обучение? Чьи адаптеры и дообученные слои — ваши или производные по условиям upstream-лицензии?
Я пока не нашла на рынке модели, где все пять ответов звучат как «полностью наши». Даже у фронтир-компаний в стеке лежат лицензированные данные и открытые компоненты. Для дообученной модели матрица прав — нормальное состояние, а не диагноз.
Эти же пять вопросов задаёт инвестор на due diligence и enterprise-заказчик перед контрактом, почти дословно: покажите, из чего состоит ваша модель и на каком основании вы используете каждый слой.
Пять вопросов — проверка на час с командой. Ответ «надо посмотреть лицензию» — нормальный результат первой итерации. Хуже, когда вопрос впервые звучит в чужом кабинете.
Закрывающая заметка
Это операционная диагностика, а не правовое заключение. Ответы на пять вопросов зависят от юрисдикции — статус весов, патентоспособность методов и объём прав на данные в разных правопорядках выглядят по-разному. По конкретной сделке ответ должен давать специалист по применимому праву.
Представим команду за неделю до раунда. Продукт работает: открытая модель, дообученная на собственных данных поддержки, закрывает заявки быстрее людей. В презентации есть слайд «Proprietary AI model». Инвестор читает его и задаёт один вопрос: что именно здесь ваше?
Дальше обычно наступает пауза. Не потому, что команда что-то скрывает. Потому, что слово «модель» в этом вопросе означает не одну вещь, а стопку разных, и права на каждую живут по своим правилам.
Я разбирала, как оформляют права на модели крупные AI-компании: публичное описание соглашения OpenAI и Microsoft, руководства WIPO по охране AI-систем, тексты лицензий от Apache 2.0 до Llama Community License, патентные реестры. Исследовательский вопрос простой: что именно принадлежит компании, когда ей «принадлежит модель»?
Чем меньше компания, тем быстрее этот вопрос приходит к ней снаружи: от инвестора, enterprise-заказчика или площадки, на которую она выходит.
Даже владельцы фронтир-моделей не считают модель одним активом
В публичном описании соглашения OpenAI и Microsoft отдельными позициями названы конфиденциальные методы исследований, архитектура модели, веса, inference-код и код дообучения. Отдельные строки. Отдельные права.
Это не юридическая педантичность. WIPO разводит те же режимы: авторское право в ML-системах защищает прежде всего код, модель в широком смысле держится комбинацией авторского права, патентов и коммерческой тайны, а веса и параметры приведены как пример информации, которую охраняют режимом конфиденциальности.
Если так считают те, у кого моделей больше всего, фразу «это наша модель» стоит разобрать на части раньше, чем это сделает чужой юрист.
Разложите модель на слои
| Слой | Что это | Чем охраняется |
| Архитектура и методы | Устройство сети, способы обучения и инференса | Патент (где выполнимы условия), секрет, осознанная публикация |
| Исходный код | Код обучения, inference, SDK, safety-инструменты | Авторское право, секрет, лицензии |
| Веса и чекпойнты | Численные параметры, состояния модели, адаптеры | Тайна, контроль доступа, договор; статус в авторском праве не определён |
| Рецепт обучения | Состав и пропорции данных, гиперпараметры, синтетика | Почти целиком тайна |
| Данные и evals | Обучающие наборы, разметка, бенчмарки, red-team наборы | Договоры, лицензии, тайна |
| Alignment и промпты | Reward-модели, правила безопасности, системные промпты, skills | Авторское право на текст и код, секрет, лицензии |
| Инфраструктура и API | Сервинг, протоколы, SDK | Патенты, авторское право, открытые лицензии |
| Бренд | Имена моделей, знаки совместимости | Товарные знаки, правила экосистемы |
Авторское право здесь охраняет конкретное выражение: написанный код, текст, документацию. Метод оно не охраняет: WIPO прямо описывает возможность законно воспроизвести ту же функциональность другим кодом. Поэтому один слой без остальных почти ничего не гарантирует.
Из таблицы следует неудобное правило. Нельзя владеть моделью сильнее, чем вы владеете каждым её слоем.
Эта строка выглядит банальной ровно до первого due diligence.
Считайте веса тайной, а не произведением
Веса — самый ценный файл в компании и самое слабое место всей конструкции «наша модель».
Есть ли у весов автор? Есть ли оригинальность? Считать ли копией независимо обученный дубль, который ведёт себя почти так же? Единого мирового ответа на эти вопросы нет.
Поэтому закрытые компании на практике охраняют веса не как произведение, а как тайну: ограничение доступа, договорные запреты, физическое неотчуждение файла. Модель продаётся через API, и API здесь — не способ доставки, а архитектура ограждения: пользователь получает результат, но не получает веса, код, рецепт и внутреннюю маршрутизацию.
Самый ценный файл — с самым неясным правовым статусом. Это не парадокс, это устройство отрасли.
Прочитайте лицензию под своим fine-tune
Теперь главный для практики слой. Команда дообучила открытую модель и называет результат своим. Юридически там появляется слоёное владение: базовые веса живут по условиям upstream-лицензии, новые адаптеры и дельта-веса могут принадлежать разработчику, данные используются на своих основаниях, имя модели упирается в товарные знаки.
И лицензии дают очень разные ответы.
Apache 2.0 — широкие права на использование, изменение и коммерческое распространение, плюс отдельная патентная оговорка. Llama 4 Community License — собственные условия Meta: политика допустимого использования включена в договор, порог по аудитории для крупных сервисов, требования к наименованию производных. Условия Gemma идут дальше: понятие Model Derivatives охватывает и модели, созданные переносом паттернов через выводы — дистилляцией или синтетическими данными — с намерением повторить поведение Gemma; при этом сами выводы производными не считаются. DeepSeek-R1 распространяется под MIT с прямым разрешением дистилляции, но дистиллированные варианты наследуют лицензии базовых Qwen и Llama.
Что ваша лицензия говорит про производные? Про дистилляцию? Про коммерческое использование? Про имя? Про использование выводов для обучения другой модели?
Ответ «мы дообучили, значит наше» не выдерживает первого чтения лицензии.
Не принимайте открытые веса за open source
На рынке постоянно смешивают несколько разных режимов. Проприетарная модель за API: доступ есть, весов и кода нет. Open-weight: веса можно скачать, но данные не раскрыты, код может отсутствовать, а лицензия — содержать ограничения. Source-available: часть кода показана, но без свобод открытой лицензии. Open source AI в строгом смысле: определение OSI требует для модифицируемости не только параметры, но и код, и достаточно подробную информацию о данных. И открытый стандарт: открыт интерфейс, а реализации и модели вокруг него могут быть закрыты.
«Компания открытая» — почти пустое утверждение, пока не названы три вещи: что именно открыто, под какой лицензией, с какими ограничениями.
Соберите пять ответов до чужого кабинета
Фраза «наша модель» раскладывается на пять вопросов:
Чья архитектура? Чей код обучения? Чьи веса — и что написано в лицензии базовой модели? Чьи данные — и на каком основании они попали в обучение? Чьи адаптеры и дообученные слои — ваши или производные по условиям upstream-лицензии?
Я пока не нашла на рынке модели, где все пять ответов звучат как «полностью наши». Даже у фронтир-компаний в стеке лежат лицензированные данные и открытые компоненты. Для дообученной модели матрица прав — нормальное состояние, а не диагноз.
Эти же пять вопросов задаёт инвестор на due diligence и enterprise-заказчик перед контрактом, почти дословно: покажите, из чего состоит ваша модель и на каком основании вы используете каждый слой.
Пять вопросов — проверка на час с командой. Ответ «надо посмотреть лицензию» — нормальный результат первой итерации. Хуже, когда вопрос впервые звучит в чужом кабинете.
Закрывающая заметка
Это операционная диагностика, а не правовое заключение. Ответы на пять вопросов зависят от юрисдикции — статус весов, патентоспособность методов и объём прав на данные в разных правопорядках выглядят по-разному. По конкретной сделке ответ должен давать специалист по применимому праву.