OpenAI隐私过滤器跨语言跨领域评估:42个基准测试结果
原标题:Evaluating OpenAI's Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks
AI 摘要
一项独立研究首次系统评估了OpenAI的隐私过滤器(OPF),这是一个15亿参数的双向PII检测器,在42个跨22种语言和5个领域的合成基准上进行测试。零样本情况下,OPF在AI4Privacy上F1=0.855,在SPY medical上为0.464,优于Presidio和XLM-RoBERTa,但在多语言NER任务中,XLM-RoBERTa在所有13种印度语和非拉丁语言上领先。OPF在结构化合成PII和客户支持方面表现最佳,但在叙事文本和非拉丁文字上性能急剧下降,且对文化变异性PII类型较弱。
正文节选
Computer Science > Computation and Language Title:Evaluating OpenAI's Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks View PDF HTML (experimental) Abstract:We present the first independent, systematic evaluation of OpenAI's Privacy Filter (OPF), a 1.5B-parameter bidirectional PII detector, across 42 synthetic benchmarks spanning 22 languages and 5 domains. Zero-shot, OPF achieves F1=0.855 on AI4Privacy and 0.464 on SPY medical, outperforming Presidio (0