OpenAI внедряет в ChatGPT систему неявной идентификации сгенерированного контента в странах Евросоюза. Это нововведение обусловлено требованиями европейского регламента об искусственном интеллекте, согласно которому необходимо обеспечить программное распознавание материалов, созданных генеративными алгоритмами.
В основе решения лежит механизм textGrain, который не внедряет в текст скрытые символы, лишние пробелы или экзотические знаки. Вместо этого он изменяет статистическую частотность выбора лексем и токенов по заданной схеме. Такой подход позволяет специализированному детектору с высокой вероятностью устанавливать источник текста.
Ранее OpenAI уже разрабатывала аналогичный инструмент, однако не запускала его в широкое использование из-за риска ложных срабатываний, например, при оценке студенческих работ. Сейчас маркировка постепенно начинает применяться к материалам, создаваемым пользователями ChatGPT и Codex на территории ЕС.
Тем не менее данная технология остаётся чувствительной к правкам. Внутренние испытания показали, что детектор верно определял около 80% помеченных фрагментов длиной 200 токенов и до 95% фрагментов на 400 токенов. Однако при замене четверти слов точность распознавания падает примерно до 17%.
ОpenAI отмечает, что наличие маркера не служит доказательством полного копирования текста из ChatGPT: система не указывает, какая доля материала была сгенерирована ИИ и насколько существенно его доработал человек. Аналогичный метод маркировки для соблюдения норм ЕС применяет и Anthropic в ряде моделей Claude.




