Прежде чем отправлять что-либо в API, я хочу анонимизировать или удалить конфиденциальные данные.
Мои текущие вопросы:
1. Каковы надежные подходы к обнаружению личных данных в тексте перед отправкой их в LLM?
- Методы на основе регулярных выражений или обнаружение на основе NLP/ML
- Любые рекомендуемые библиотеки Python?
Пример:
Код: Выделить всё
"John Smith from ACME Corp called me at 555-1234"
→
"[NAME] from [ORG] called me at [PHONE]"
4. Известны ли компромиссы между анонимизацией и производительностью/точностью модели?
Для контекста: в настоящее время я использую Python и напрямую вызываю API-интерфейсы GPT, но я открыт для архитектурных шаблонов или подходов промежуточного программного обеспечения.
Любые примеры кода или лучшие практики были бы очень полезны.