PII Guard 是由 LLM 驱动的工具,用于检测和管理日志中的个人身份信息(PII),被描述为旨在支持数据隐私和 GDPR 合规。仓库声明它是个人业余项目,用于探索大语言模型如何比传统基于正则的方法更智能地检测日志中的敏感数据。 该项目对大语言模型进行实验,特别是通过 Ollama 在本地运行的 gemma:3b 模型,以评估它们在结构化和非结构化日志数据中识别 PII 的效果。根据 README,它利用自然语言理解分析日志,比正则更好地处理真实世界中杂乱的日志,即使 PII 被混淆、不完整或嵌在文本中也能识别。它还据称能处理多语言输入和不一致的格式,并利用语义上下文而不是依赖静态模式。 README 按几个类别列出了检测到的 PII 类型:身份信息(如 full-name、email、phone-number 和 address)、GDPR 第 9 条下的敏感类别、政府和金融标识符、网络和设备信息,以及 license-plate 等车辆信息。 该工具用一条命令 make all-in-up 启动,会拉起完整的技术栈,包括 PostgreSQL、Elasticsearch、RabbitMQ、带 gemma:3b 的 Ollama,以及 PII Guard 仪表盘和后端 API。网页界面位于 http://localhost:3000,API 端点位于 http://localhost:8888/api/jobs。README 称该项目仍在开发中,欢迎贡献。
隐私工程师用 PII Guard 识别结构化和非结构化日志数据中的 PII。
团队用 PII Guard 检测被混淆、不完整或嵌在文本中的 PII。
团队用 PII Guard 处理多语言日志和不一致的日志格式。
注重合规的团队用 PII Guard 检测 GDPR 第 9 条的敏感类别,如健康数据和宗教信仰。
开发者用 PII Guard 向 jobs API 提交示例日志进行检测。
用户用 PII Guard 的网页界面在本地试用该工具。
测试人员用 Testing PII Guard 指南,通过模拟日志生成和压力测试评估检测准确度。