models
Модель-агностичный детектор PII на базе LLMs
Разработан на Amazon Bedrock универсальный детектор PII, который использует большие языковые модели для обнаружения личной информации без необходимости переобучения модели при добавлении новых категорий. Обеспечивает высокую точность и гибкость в различных языковых и доменных контекстах.
AS1 NewsИсточник: aws.amazon.com
В статье описывается конфигурируемый, модель-агностичный детектор личной информации (PII), основанный на больших языковых моделях (LLMs), доступных через платформу Amazon Bedrock. Такой подход позволяет адаптировать детектор к новым типам сущностей без необходимости повторного обучения модели, что значительно упрощает работу с разнородными и многомногоязычными данными.
Детектор работает на основе инструкций, которые задают схему обнаружения и ожидаемый формат вывода, что делает его независимым от конкретной модели. В качестве бэкенда может использоваться как управляемая модель Amazon Bedrock, так и собственная модель, размещенная на инфраструктуре пользователя.
Техническая реализация включает в себя шаблон промпта, интеграцию с выбранным бэкендом, слой постобработки для определения точных позиций обнаруженных сущностей и последовательность вызовов для объединения всех компонентов. В качестве примера приводится использование адаптера для Amazon Bedrock, который взаимодействует с моделью через API.
Для оценки эффективности детектора проведено сравнение с восемью другими LLM-основанными инструментами на пяти публичных датасетах, содержащих более 49 тысяч записей и свыше 222 тысяч аннотированных участков. Результаты показывают, что выбранные модели достигают точности до 83% по метрике Core F1, при этом обеспечивая возможность работы в различных языковых и доменных условиях.
Гибкость системы позволяет легко расширять список обнаруживаемых сущностей за счет изменения инструкций, что исключает необходимость переобучения модели. Это делает подход особенно привлекательным для задач, требующих быстрого реагирования на новые требования и изменения в области обработки персональных данных.
Для практического применения рекомендуется установить пакет pii-detector, настроить AWS-учетные данные, запустить пример и далее интегрировать детектор в собственные рабочие процессы для автоматической обработки и защиты данных.
Обеспечивает эффективное и гибкое обнаружение личной информации в текстовых данных, что важно для соблюдения требований по защите данных и конфиденциальности.