Как настроить ИИ-классификацию для автоматического добавления ярлыков к файлам на Google Диске

Эта функция входит в состав Frontline Plus и Enterprise Plus. а также дополнений Gemini Enterprise–Legacy, Google AI Pro for Education и AI Security.

Ярлыки классификации данных на Google Диске действуют как описательные метаданные для файлов, которые можно использовать для различных функций, таких как защита данных, аудит, расследование и хранение. ИИ-классификация для Google Диска автоматизирует процесс добавления ярлыков к файлам без необходимости написания кода.

Существует два метода классификации с помощью ИИ:

  • Специальные модели. Создайте уникальную модель машинного обучения для своей организации на основе набора данных для обучения. Как администратор, вы можете выбрать данные для обучения. Ваша модель уникальна для вашей организации.
  • Использовать Gemini (бета-версия). Используйте большие языковые модели (LLM) Gemini, чтобы проверять контент файлов и автоматически применять ярлыки на основе понятных инструкций, которые вы задаете. Этот метод не требует предварительного сбора данных или обучения модели.

Вы можете создать в общей сложности пять специальных моделей и инструкций для Gemini, включая не более одной инструкции для Gemini.

Примечание. Чтобы функция ИИ-классификации могла добавить ярлыки к файлам, они должны находиться на общих дисках или принадлежать пользователям с лицензиями, поддерживающими ярлыки классификации.

Как использовать ИИ-классификацию

Ниже описаны основные этапы настройки ИИ-классификации для автоматического добавления ярлыков к новым и существующим файлам на Диске.

1. Создайте собственную модель или инструкции для Gemini. Выберите или создайте ярлык классификации, который будет автоматически применяться к файлам.

Примечание. Если вы создаете специальную модель, вы также создаете ярлык для обучения. Используется для пометки файлов, на которых модель учится классифицировать данные.

2. (Только для пользовательской модели) Обучите модель. После создания ярлыков доверенные пользователи применяют к соответствующим файлам на Диске ярлык для обучения, чтобы создать обучающий набор данных. Затем модель использует этот набор данных, чтобы научиться классифицировать конфиденциальные файлы.

3. Включите ИИ-классификацию. После обучения модели или настройки инструкций Gemini вы можете настроить автоматическое применение ярлыков к файлам, в том числе указать параметры ярлыков и круг пользователей, к файлам которых нужно применять ИИ-классификацию. Затем модель или инструкции начнут применять ярлыки к конфиденциальным файлам.

4. Отслеживайте работу модели. С помощью журнала событий Диска можно отслеживать, сколько файлов было классифицировано, а также сколько пользователей приняли или изменили автоматически примененный ярлык (при наличии у них соответствующих разрешений).

Подготовка

  • Поймите принцип работы ярлыков классификации и как их создавать. Подробная информация приведена в статье Как начать работу с ярлыками классификации (для администраторов).
  • Выберите доверенных пользователей – группу сотрудников, которые могут вручную применять правильный ярлык для обучения к конфиденциальным файлам.
  • Создайте группу конфигурации специально для доверенных пользователей. С инструкциями можно ознакомиться в статье Как настраивать сервисы с помощью групп конфигурации.
  • Включите следующие права в аккаунте администратора: "Управление ярлыками классификации", "Управление правилом DLP" и "Просмотр правила DLP".

Как создать модель

Чтобы создать модель, сначала выберите существующий ярлык классификации или создайте новый. Затем нужно автоматически (рекомендуется) или вручную с помощью инструмента Label Manager создать соответствующий ярлык для обучения, который будут использовать доверенные пользователи.

Как выбрать или создать ярлык классификации

Ваша классификация должна быть включена для Диска и Документов. После обучения ИИ-модель будет автоматически применять ваш ярлык классификации к конфиденциальным файлам на Диске. Модель обучается только на одном поле для каждого ярлыка – или списке значков или списке вариантов.

Рекомендуем использовать ярлык конфиденциальности со значком, поскольку он хорошо заметен на документах.

Если используется поле списка вариантов или списка значков для ярлыка классификации, оно должно:

  • содержать от 2 до 7 вариантов;
  • быть опубликованным.

Если у вас уже есть ярлык, который соответствует этим требованиям, вы можете использовать его для классификации. В противном случае создайте ярлык с помощью Label Manager до или во время настройки модели (как описано ниже). Подробнее о том, как создавать ярлыки классификации для организации…

Как создать ярлык для обучения

Ярлык для обучения практически идентичен ярлыку классификации и используется только доверенными пользователями в целях обучения модели. При создании модели (как описано ниже на странице) вы можете автоматически создать ярлык для обучения, точно соответствующий ярлыку классификации.

Вы также можете создать собственный ярлык для обучения вручную с помощью Label Manager до или во время настройки модели. Подробнее о том, как создавать ярлыки для обучения вручную…

Как создать модель

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Создать модель.
  3. В списке Ярлык классификации выберите существующий ярлык и поле для обучения модели или нажмите Создать ярлык, чтобы создать новый с помощью Label Manager.

    Если вы создали ярлык в Label Manager, вернитесь на страницу Создание модели. Чтобы новый ярлык появился в списке, может потребоваться обновить страницу.

  4. В списке Название поля выберите поле для ярлыка.
  5. Нажмите Продолжить.
  6. Вы можете автоматически создать и опубликовать ярлык для обучения, соответствующий ярлыку классификации:
    1. Нажмите Создать ярлык для обучения.
    2. В появившемся сообщении выберите Обновить разрешения для ярлыка. Ярлык откроется в режиме редактирования в Label Manager на отдельной вкладке.
    3. Нажмите Разрешения > Изменить, а затем предоставьте разрешение Применение ярлыков и присвоение значений для них группе конфигурации, в которую добавлены доверенные пользователи.
    4. Нажмите Сохранить и закройте вкладку Label Manager.

      Примечание. Вы также можете настроить разрешения для ярлыка позже. Однако важно, чтобы у доверенных лиц был доступ к ярлыку для обучения.

  7. Если вы уже создали ярлык для обучения, выберите его в списке Ярлык для обучения.
  8. При необходимости теперь вы можете создать собственный ярлык для обучения, нажав Открыть Label Manager.

    Важно! Убедитесь, что ярлык соответствует критериям, предъявляемым к ярлыкам для обучения, и что вы разрешили доступ к нему только доверенным пользователям. Подробные сведения приведены в разделе Рекомендации в отношении ярлыков для обучения.

    Вернитесь на страницу Создание модели. Чтобы новый ярлык для обучения появился в списке, может потребоваться обновить страницу.

  9. На странице Создание модели нажмите Продолжить.
  10. Введите понятное название для модели.
  11. Нажмите Создать модель.

Когда модель будет создана, на странице Информация о модели появятся выбранные ярлыки для обучения и классификации.

Как обучить модель

Чтобы обучить ИИ-модель, необходимо создать обучающий набор данных, а затем начать первоначальный цикл обучения Во время цикла обучения модель учится на основе примеров из набора данных.

Переобучение выполняется автоматически. После первоначального цикла обучения модель каждые две недели проходит переобучение, чтобы сохранить или улучшить точность. При необходимости вы можете запустить переобучение вручную в любое время. После каждого цикла обучения выпускается новая версия модели, а график автоматического переобучения сбрасывается и начинается заново.

Как создать обучающий набор данных

Чтобы создать обучающий набор данных, доверенным пользователям нужно применить каждый вариант ярлыка хотя бы к 100 файлам. Например, если у вашего ярлыка есть 3 варианта (например, "Принцип минимальной необходимой осведомленности", "Конфиденциально" и "Для всех"), для обучения понадобится не менее 300 файлов. Рекомендуем использовать более 100 файлов для каждого варианта, потому что некоторые файлы, скорее всего, не подойдут для обучающего набора данных. Подробнее о выборе высококачественных примеров для обучения…

Примечание. Обучающий набор данных может содержать не более 1 миллиона файлов.

После создания модели она автоматически определит количество файлов с ярлыками для обучения за 24 часа. Проверка будет повторяться в течение дня.

Чтобы узнать количество файлов с ярлыками:

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. В списке Действия для нужной модели выберите Посмотреть подробные инструкции.
  4. На панели сверху в разделе Файлы для обучения (активная модель) будет указано количество файлов, к которым был применен ярлык.

Если файлов для обучения модели достаточно, будет указан статус "Готово".

Начните цикл обучения

Цикл обучения обычно длится 4–6 часов, но при использовании больших наборов данных понадобится больше времени. Чтобы научиться применять ярлыки с достаточной точностью, модели может потребоваться несколько циклов обучения.

Во время цикла обучения модель сравнивает выбранную ей классификацию для файла с примененным к нему ярлыком для обучения и определяет оценку. Подробнее о том, как рассчитываются оценки…

После завершения цикла обучения вы можете проверить точность модели.

Чтобы начать цикл обучения:

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. На странице Информация о модели в разделе Действия для модели выберите Посмотреть подробные инструкции.
  4. Вверху страницы на панели обучения нажмите Начните цикл обучения.

    Примечание. Эта кнопка доступна только в том случае, если доверенные пользователи применили ярлыки к минимальному необходимому количеству файлов для обучения.

Как проверить оценки модели (после обучения)

После цикла обучения выпускается новая версия модели с оценками в процентах для каждого варианта ярлыка. Каждая оценка, называемая оценкой запоминаемости, – это процент обучающих примеров, которые модель классифицировала правильно по результатам самопроверки:

  • Меньше 50 % – низкая точность. Модели нужны более качественные данные. Она ещё не готова.
  • 50–80 % – средняя точность. Модель готова, но ее возможности ограничены.
  • Больше 80 % – высокая точность. Модель готова классифицировать файлы вашей организации.

Чтобы узнать точность модели после цикла обучения, выполните описанные ниже действия.

На странице Посмотреть подробные инструкции можно посмотреть оценки модели:

  • Вверху страницы на панели результатов обучения в разделе Текущие файлы и результаты.
  • На панели Текущий обучающий набор данных.

Как создать инструкции для Gemini

Чтобы создать набор инструкций для Gemini, сначала выберите предопределенный ярлык, содержащий инструкции, или существующий ярлык классификации. Прежде чем начать, убедитесь, что ваш ярлык соответствует необходимым критериям. Подробнее о том, как выбрать или создать ярлык классификации…

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Использовать Gemini.
  3. На странице Выберите ярлык, который Gemini будет применять выберите один из вариантов:
    • Выберите Применить стандартный ярлык, чтобы использовать стандартный ярлык с инструкциями из шаблона, которые можно изменить.
    • Выберите Применить собственный ярлык, чтобы использовать один из существующих ярлыков вашей организации.
  4. Если вам нужен новый ярлык, нажмите Создать ярлык, чтобы открыть Label Manager в новой вкладке браузера.
    • Примечание. После того как вы создадите и опубликуете новый ярлык на вкладке "Менеджер ярлыков", вернитесь на вкладку Использование Gemini для применения ярлыков. Обновите страницу, чтобы увидеть доступные варианты.
  5. Если вы выбрали вариант Применить собственный ярлык, нажмите на раскрывающееся меню Ярлык классификации и выберите ярлык.
  6. Нажмите Название поля > выберите поле.
  7. Нажмите Продолжить.
  8. На странице Изучите инструкции для Gemini добавьте понятные и подробные инструкции для каждого варианта ярлыка, чтобы Gemini было проще классифицировать данные вашей организации. Для каждого варианта укажите:

    • Что представляет собой вариант, например категорию, тип или характеристику.
    • Как Gemini должен определять вариант, например по подсказкам или ключевым словам.
    • Как Gemini должен обрабатывать исключения, например ситуации, в которых вариант не должен применяться.
  9. Нажмите Продолжить.

  10. На странице Выберите варианты ярлыка, которые можно применять автоматически установите флажки рядом с вариантами ярлыков, которые Gemini должен применять автоматически.

    • Примечание. Gemini не будет применять к файлам на Диске варианты, которые не выбраны.
  11. Нажмите Продолжить.

  12. На странице Проверьте инструкции и укажите их название введите понятное название в поле Название*. Проверьте и подтвердите данные, чтобы обеспечить точность.

  13. Нажмите Сохранить или Сохранить и настроить автоприменение.

Как включить классификацию с помощью ИИ

После того как вы настроите инструкции для Gemini или обучите собственную модель ИИ до минимального уровня точности (не менее 50 %), вы можете выбрать варианты ярлыков и включить их автоматическое применение к файлам. Чтобы получить наилучшие результаты с помощью специальной модели, рекомендуем подождать, пока оценки модели для всех вариантов ярлыка достигнут 80%.

Как включить автоматическое применение

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. На странице Информация о модели в разделе Действия для модели выберите Посмотреть подробные инструкции.
  4. Вверху страницы на панели обучения нажмите Настроить автоматическое применение.

    Примечание. Эта кнопка доступна только в том случае, если хотя бы для одного варианта ярлыка достигнута точность 50 %.

    Если вы ранее настроили автоматическое применение, в разделе Файлы с ярлыками, присвоенными ИИ нажмите Изменить настройки автоматического применения.

  5. Установите флажки для вариантов ярлыка, которые ИИ-модель должна применять автоматически.
  6. Нажмите Сохранить и продолжить, чтобы выбрать организационные подразделения или группы, к файлам которых модель должна автоматически применять ярлыки. По умолчанию выбрана родительская организация верхнего уровня.

    Если вы хотите выбрать пользователей позже, нажмите Сохранить.

  7. Если вы хотите выбрать пользователей, сбоку выберите организационное подразделение или группу конфигурации.

    Настройки группы переопределяют значения для организационных подразделений. Подробнее…

  8. Нажмите ВКЛ – ярлык будет применяться автоматически с одним из указанных ниже вариантов.
  9. Нажмите Сохранить.

    На странице Информация о модели у параметра Текущий статус правила будет значение Включено.

Примечание. Вы можете отслеживать ИИ-классификацию с помощью журнала событий Диска. Подробнее…

Когда функция ИИ-классификации сканирует файлы

После включения автоматического применения для файлов, принадлежащих пользователям и размещенных на общих дисках, функция ИИ-классификации сканирует их (при хранении) не реже раза в 1–2 недели. Функция ИИ-классификации также сканирует файлы при загрузке и изменении. Она может изменить примененный ярлык, если содержимое файла изменится.

Примечание. При использовании ИИ-классификации с инструкциями Gemini сканирование неактивных файлов необходимо включить вручную. Чтобы активировать эту функцию, нажмите Применять ярлык к неактивным файлам на странице Инструкции.

Как решаются конфликты при автоприменении

Правила защиты данных

Значения ярлыка, заданные правилами защиты данных, имеют приоритет над ИИ-классификацией, и оба значения имеют приоритет над классификацией по умолчанию.

Несколько специальных моделей или инструкций для Gemini

Если два или более источника классификации с помощью ИИ пытаются применить разные варианты ярлыков из одного и того же поля ярлыка к одному и тому же файлу, применяется вариант, который находится выше в списке вариантов ярлыка. Например, у ярлыка может быть поле с тремя вариантами в Label Manager:

  1. Конфиденциально
  2. Для внутреннего пользования.
  3. Доступно всем

Если источник 1 попытается применить к файлу ярлык Конфиденциально, а источник 2 – Для общего пользования, будет применено значение Конфиденциально, поскольку оно находится выше в списке вариантов ярлыка. Прежде чем настраивать правила, убедитесь, что варианты поля ярлыка указаны в нужном порядке приоритета.

Ярлыки, примененные пользователями

Ярлыки, которые пользователи применили к файлам, имеют приоритет над теми, что применяет функция ИИ-классификации – она не может изменять заданные пользователями ярлыки.

Примечание. Если пользователь примет или изменит ярлык, присвоенный ИИ, он будет считаться примененным пользователем, и функция классификации с помощью ИИ больше не будет изменять его значение.

Как отслеживать работу модели

Сведения о том, как функция ИИ-классификации применяет ярлыки к файлам, можно найти в журнале событий Диска. Для каждого варианта ярлыка в журнале показано, какое количество файлов было классифицировано с помощью автоматического применения и сколько пользователей приняли или изменили ярлык. Пользователям нужны разрешения, чтобы взаимодействовать с автоматически примененными ярлыками.

Разрешения, необходимые пользователям для взаимодействия с автоматически примененными ярлыками

Для взаимодействия с автоматически примененными ярлыками пользователям нужны разрешения на доступ к соответствующему файлу и ярлыку. Вы можете настроить разрешения для ярлыка классификации в Label Manager. Подробнее о том, как создавать ярлыки классификации для организации…

  • Для просмотра автоматически примененных ярлыков пользователям нужно разрешение Просмотр этого ярлыка.
  • Чтобы принять или изменить автоматически примененный ярлык, пользователям нужно разрешение Применение ярлыков и присвоение значений для них для ярлыка и Редактор или Владелец для файла.

Как посмотреть события ИИ-классификации в журнале событий Диска

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. На странице Информация о модели в разделе Файлы с ярлыками, присвоенными ИИ выберите Открыть рядом с нужным вариантом ярлыка.

    В новой вкладке откроется инструмент "Анализ безопасности", в котором будут показаны результаты поиска в журнале событий Диска двух событий, связанных с ИИ-классификацией: Ярлык применен и Значение поля "Ярлык" изменено.

  4. Выберите Описание для события, чтобы ознакомиться с дополнительными сведениями, например:
    • Название и тип документа, к которому был применен ярлык.
    • Значение поля ярлыка, назначенного документу (например, "Конфиденциально" или "Доступ ограничен").

Как посмотреть процент принятия инструкций Gemini

На странице Сведения о модели для классификации с помощью ИИ на диаграмме Принятие пользователями представлены данные об эффективности ваших инструкций, полученные на основе отзывов пользователей за последние 180 дней.

Показатели:

  • Проверено пользователем – общее количество пользователей, которые взаимодействовали с баннером автоматического применения ярлыка, чтобы принять или изменить вариант ярлыка, примененный с помощью Gemini.
  • Пользователь принял. Общее количество пользователей, которые решили сохранить ярлык, предложенный Gemini.

Как управлять моделью

Как отключить автоматическое применение ярлыка классификации

Как отключить автоматическое применение для всех или только для отдельных вариантов ярлыков

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. На странице Информация о модели в разделе Действия для модели выберите Посмотреть подробные инструкции.
  4. В разделе Файлы с ярлыками, присвоенными ИИ нажмите Изменить настройки автоматического применения.
  5. Снимите флажки рядом с теми вариантами ярлыков, которые вы не хотите применять автоматически.

    Чтобы полностью приостановить автоматическое применение, снимите все флажки.

Как полностью отключить автоматическое применение для отдельных организационных подразделений или групп

Вы можете отключить автоматическое применение для всего контента, принадлежащего пользователям в определенных организационных подразделениях или группах.

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. На странице Информация о модели в разделе Действия для модели выберите Посмотреть подробные инструкции.
  4. Вверху страницы в меню Ещё нажмите Настроить автоматическое применение > Обновить выбранные организационные подразделения или группы.
  5. Нажмите на организационное подразделение или группу, чтобы выбрать ее.
  6. Выберите ВЫКЛ – ярлыки не будут применяться автоматически.
  7. Нажмите Сохранить.

Как удалить собственную модель или инструкции для Gemini

Возможно, вам понадобится удалить специальную модель или инструкции для Gemini, например если их точность не соответствует требованиям. В таком случае все ее настройки ИИ-классификации будут удалены без возможности восстановления. Примечание

  • Ярлыки, используемые в модели или инструкциях Gemini, отменяются в настройках классификации ИИ, а история модели или инструкций Gemini удаляется. Однако сами ярлыки не удаляются и ими по-прежнему можно управлять в Label Manager.
  • (Только для специальной модели) Ярлыки для обучения остаются примененными к файлам. После удаления модели вы можете решить настроить новую модель, чтобы использовать тот же ярлык для обучения. Модели будут предоставлять аналогичные результаты, если вы повторно обучите их на основе существующих ярлыков и файлов для обучения.
  • Автоматическое применение ярлыков, включенное для модели, немедленно прекращается. Вы можете удалить или сохранить ярлыки, ранее автоматически примененные к файлам, которые не были приняты или изменены пользователем.
  • Если вы создадите новую модель или инструкции Gemini, используя тот же ярлык классификации, функция классификации с помощью ИИ перезапишет результаты предыдущей классификации. Это позволяет повторно обработать файлы организации на Диске. Это может быть полезно, если качество модели или инструкций значительно улучшилось с момента начала использования.

Чтобы удалить модель или инструкции:

  1. В консоли администратора Google нажмите на значок меню > Безопасность > Управление доступом и данными > Классификация данных.

    У вас должны быть права администратора на просмотр правил DLP и управление ими.

  2. В разделе ИИ-классификация нажмите Посмотреть сохраненные модели.
  3. На странице Список моделей нажмите Действия рядом с моделью или инструкциями и выберите Удалить модель или Удалить инструкции. В диалоговом окне будут перечислены последствия удаления, и вы сможете решить, сохранить или удалить ранее примененные ярлыки:
    • Сохранить примененные ярлыки. Ярлыки, примененные ранее по любой версии этих инструкций, останутся назначены файлам.
    • Удалить примененные ярлыки. Ярлыки, примененные ранее по любой версии этих инструкций, будут удалены из файлов. Удаление ярлыков может занять до двух недель. Ярлыки не будут удалены, если они были изменены пользователем, правилами, другой ИИ-моделью или инструкциями Gemini.
  4. Установите флажок, чтобы подтвердить, что вы понимаете, что это действие нельзя отменить.
  5. Чтобы подтвердить действие, нажмите Удалить модель или Удалить инструкции.

Часто задаваемые вопросы

Ярлыки для обучения и классификации

Какие требования к ярлыкам для обучения и классификации?

Оба вида ярлыков должны соответствовать следующим критериям:

  • Включать от 2 до 7 вариантов.
  • Иметь одинаковый порядок вариантов.
  • Должен быть опубликован.
  • Должен содержать ярлыки с разными настройками доступа. Ярлык для обучения должен быть доступен только доверенным пользователям. К ярлыку классификации можно предоставить более широкий доступ.

Как создать ярлык для обучения вручную?

Хотя мы рекомендуем при настройке модели выбрать автоматическое создания ярлыка для обучения, вы можете создать его вручную в Label Manager, следуя указанным ниже рекомендациям.
  • Убедитесь, что ярлык соответствует критериям.
  • Обозначьте ярлык словом "обучение", чтобы доверенным пользователям было проще его узнавать и применять к обучающему набору данных.
  • Для удобства доверенных пользователей добавьте к ярлыку для обучения поле описания.
  • Обязательно разрешите применение ярлыков только доверенным пользователям (тем, кто классифицирует файлы для обучения модели), используя созданную для доверенных пользователей группу конфигурации.

Можно ли использовать ярлык для классификации в качестве ярлыка для обучения?

Нет. Нужно использовать два разных ярлыка. Ярлык, выбранный для классификации, не будет доступен для выбора в качестве ярлыка для обучения.

Может ли Google использовать мои личные данные для обучения глобальных моделей, если я даю инструкции Gemini?

Нет. Все операции выполняются в строгих границах изоляции. Контент вашего внутреннего Диска и связанные с ним запросы надежно изолированы в вашей авторизованной среде Workspace и не используются для обучения моделей Google. Подробнее о наших принципах защиты данных и обеспечения безопасности можно узнать в Центре конфиденциальности.

Обучающие наборы данных

На каких файлах рекомендуется обучать модель?

Чтобы получить наилучшие результаты при обучении модели, попросите доверенных пользователей соблюдать следующие рекомендации:

  • В каждом файле должно быть не менее 500 символов.
  • Файлы должны наилучшим образом представлять фактический контент, который сотрудники создают, публикуют и используют.
  • Следует выбрать примерно одинаковое количество файлов (не менее 100) для каждого варианта ярлыка. Это поможет модели получить комплексное представление о данных и обеспечить более высокую точность.
  • Включите репрезентативную выборку файлов для каждого варианта. Например, не помечайте 100 резюме как общий набор примеров файлов для варианта "Совершенно секретно", если в вашей организации к нему также относятся контракты.
  • Применяйте ярлык классификации только к файлам, принадлежащим вашей организации, – либо принадлежащим пользователям, либо хранящимся на общих дисках. Функция ИИ-классификации не обрабатывает файлы, принадлежащие внешним пользователям и расположенные на внешних общих дисках.

Можно ли обучить модель на файлах, к которым были применены ярлыки ранее?

Сейчас нельзя проводить обучение на файлах, к которым были применены ярлыки ранее. Для модели необходимо, чтобы ярлык для обучения был репликой ярлыка, который она будет автоматически применять к файлам, но они не могут быть одинаковыми.

Можно ли обучить модель на нескольких языках?

Модель поддерживает несколько языков. Однако в данные для обучения нужно включить репрезентативную выборку файлов для каждого варианта и языка. Таким образом, для успешного обучения модели понадобится больше файлов. Поддерживаются только языки на основе латинского алфавита.

Как рассчитываются оценки при обучении?

Во время обучения модель ИИ использует 75 % входных данных для обучения, а 25 % – для того, чтобы периодически проверять собственную точность. Иными словами, 25% файлов модель анализирует так, как если бы к ним не был применен ярлык. Затем она выбирает ярлык и сравнивает с ярлыком, который применил доверенный пользователь. Оценки показывают, к какой части зарезервированных файлов она применила ярлык правильно.

Когда я обучу модель, могу ли я зафиксировать ее состояние, чтобы остановить автоматическое переобучение?

Для обучения моделей ИИ-классификации используются файлы на Диске. Когда эти файлы удаляются (часто в соответствии с графиком хранения в Google Сейфе), модель также нужно затем удалить, чтобы контент файлов не сохранился в какой-либо форме. Поэтому с определенной периодичностью выполняется переобучение модели, которое нельзя приостановить.

Могут ли пользователи изменить или закрепить ярлыки и значения полей?

Пользователи с разрешением могут обновить ярлык или значение поля, но функция ИИ-классификации не может обновить модель на основе этого изменения. Если вы обнаружите, что модель применила ярлыки и значения полей неправильно, попросите доверенных пользователей назначить файлам правильный ярлык для обучения. В ходе следующего цикла самообучения функция ИИ-классификации включит эти данные в новую модель.

Автоматическое применение

Может ли функция ИИ-классификации оценивать изображения, видео- и аудиофайлы?

Функция ИИ-классификации обрабатывает индексируемый текст так же, как и правила DLP Диска. Подробнее о типах файлов, которые сканирует DLP… Любой файл, из которого Диск может извлечь индексируемый текст, может быть обработан функцией классификации с помощью ИИ для применения ярлыков. в том числе с помощью оптического распознавания символов на изображениях. Однако функция ИИ-классификации не оценивает видео- и аудиофайлы.

ИИ-классификация подходит для добавления ярлыков только к деликатному контенту?

Конфиденциальный контент – эта основная область применения этой функции, но вы можете обучить модель для автоматического применения любого ярлыка, у которого не более четырех вариантов. Ярлыки классификации также используются для аудита, обнаруживаемости и управления хранением.

Работает ли ИИ-классификация, если включено клиентское шифрование?

Поскольку системы Google не могут расшифровать файлы, зашифрованные на стороне клиента (это возможно только с использованием личного ключа шифрования), функция ИИ-классификации не может обучаться на таких файлах и не может автоматически применять к ним ярлыки.

Как и когда функция ИИ-классификации пересматривает автоматически примененные ярлыки?

После включения автоматического применения функция ИИ-классификации сканирует и классифицирует все файлы в состоянии покоя, из которых можно извлечь достаточный объем текста. Эти файлы сканируются, по меньшей мере, один раз.

Функция ИИ-классификации время от времени обрабатывает файлы повторно по мере внесения изменений в контент. При изменении контента прогноз для файла может измениться. Если в распоряжении ИИ-функции классификации есть и старые, и новые спрогнозированные варианты для файла, будет выбран тот, что находится выше в списке. Например, в поле в Label Manager есть три значения:

  • Конфиденциально.
  • Для внутреннего пользования.
  • Доступно всем

Допустим, функция классификации с помощью ИИ назначила файлу ярлык Для внутреннего пользования, а после изменения контента – Конфиденциально. В таком случае классификация для файла изменится на Конфиденциально. Однако если модель ИИ-классификации прогнозировала ярлык Для общего пользования, у файла останется ярлык Для внутреннего пользования.

Функция ИИ-классификации не пересматривает автоматически примененные ярлыки и значения полей, которые ранее проверили или изменили пользователи.

Если модель изменится, будет ли она автоматически переоценивать существующие файлы?

Файлы обрабатываются новейшей моделью при создании или изменении. Существующие файлы не обрабатываются повторно автоматически при выпуске новой версии модели. Однако модель может периодически повторно обрабатывать все ваши файлы с помощью последней версии независимо от обновлений или переобучения.

Имеет ли ИИ-классификация приоритет над другими способами классификации, если их применяется несколько?

Классификацию данных можно переопределить. Классификация данных выполняется в следующем порядке:
  1. правило защиты данных без перезаписи пользовательского значения;
  2. классификация вручную;
  3. правило защиты данных с перезаписью пользовательского значения;
  4. Классификация ИИ
  5. классификация по умолчанию.
Удаление ярлыка или поля позволяет применить способ классификации более низкого уровня. Например, если пользователь удалил ярлык файла, функция ИИ-классификации может позже автоматически применить тот же ярлык.

К файлам каких типов функция ИИ-классификации может применять ярлыки?

  • Функция ИИ-классификации обрабатывает индексируемый текст так же, как и правила DLP Диска. Вы можете ознакомиться со списком файлов, которые сканирует функция DLP. Аудио- и видеофайлы не поддерживаются.
  • Чтобы функция ИИ-классификации могла применить ярлык, файл должен содержать минимальное необходимое количество текста. Поэтому некоторые файлы, например маленькие документы и изображения с небольшим количеством текста, не будут классифицированы.

Что будет, если автоприменение варианта отключено?

Если при сканировании будет определено, что у файла есть вариант, для которого отключено автоприменение, функция классификации с помощью ИИ не применит к файлу ни ярлык, ни значение поля.

У файлов, ранее помеченных функцией ИИ-классификации, примененный ярлык и значения вариантов сохранятся даже после отключения варианта.

Можно ли отменить автоматически примененные ярлыки?

Применение ярлыков отменить нельзя. Рекомендуем проверять и улучшать модели на ограниченной группе пользователей, прежде чем разворачивать их для всех сотрудников. Например, вы можете обучить модели с использованием временного ярлыка. Добившись удовлетворительной эффективности модели, вы можете "сбросить" ее – удалить и создать новую модель с тем же ярлыком для обучения (тем же обучающим набором данных), но с вашим основным ярлыком.

Модели Gemini и специальные модели

Полностью ли классификация с помощью ИИ и инструкций Gemini заменяет существующие собственные модели?

Нет. Инструкции Gemini – это дополнительная альтернатива. Классические модели создают изолированную модель, предназначенную для определенного клиента и адаптированную исключительно к его историческим данным, а инструкции Gemini используют предварительно обученную базовую модель для оценки контента на основе заданных вами текстовых правил.

Как понять, когда использовать инструкции Gemini, а когда – классические модели?

Организациям не обязательно выбирать только одну архитектуру. Оба режима можно использовать одновременно, чтобы поддерживать разные этапы классификации данных в соответствии с потребностями организации.

Из каких элементов состоят инструкции по классификации данных?

Инструкция по классификации – это структурированный план, который передается Gemini. Чтобы Gemini было проще классифицировать данные, добавьте понятные и подробные инструкции для каждого варианта ярлыка, в том числе о том, что представляет собой вариант, как Gemini должен его идентифицировать и как обрабатывать исключения.

Как работает классификация с помощью ИИ Gemini

Почему Gemini иногда назначает разные варианты ярлыков идентичным или почти идентичным файлам?

Большие языковые модели по своей природе вероятностные, а не детерминированные. Традиционный код следует фиксированной логике и выдает одинаковые результаты для одного и того же входного значения, а большие языковые модели генерируют ответы на основе статистических вероятностей. На этот процесс могут влиять внутренние параметры, например "температура", которая вносит в выбор модели определенную долю вариативности. Кроме того, на внутреннюю логику модели могут влиять внешние переменные, из-за чего для одинаковых или почти одинаковых файлов могут быть получены разные результаты. Например, это может быть связано с обновлением базовой модели, изменениями в инструкциях на уровне системы или даже с датой и временем запроса на классификацию. В результате эти динамические элементы гарантируют, что Gemini оценивает каждый файл в уникальном контекстном окне, что иногда приводит к разным назначениям ярлыков.