优化数据相似性 API 是一个高速模糊匹配和去重 API,专为现实世界中的混乱数据构建。它帮助您识别接近重复的记录并调和实体,即使值不完全匹配——拼写错误、大写差异、缺少标点、空格问题、缩写和次要的词序变化。
与其构建和调优自己的模糊匹配管道,不如将您的字符串(或记录)发送到 API,并获得可以信任的相似性评分匹配。典型的输出包括匹配对(例如,“Apple” ⇄ “apple inc.”)、相似性分数以及易于插入数据清洗工作流、CRM、ETL 作业和分析管道的结构化结果。
常见用例:
去重列表:在数据集中查找重复项(全对全匹配)并返回可能的重复对。
与主列表对账:将传入列表与标准集合匹配(列表到主列表)。
CRM 和客户数据清理:清理重复数据,导致报告和外展被破坏的潜在客户/账户/公司。
实体解析与记录链接:跨来源连接同一现实世界实体的引用。
团队使用它的原因:
开箱即用处理混乱文本(没有针对每种边缘情况的手动规则)
用于排名和阈值的相似性分数(您可以选择严格程度)
为规模和自动化而构建(设计用于在管道中运行,而不仅仅是一次性脚本)
{"status":"success","response_data":[["Apple","appl!e",1.0]]}
curl --location --request POST 'https://zylalabs.com/api/11920/optimized+data+similarity+api/22654/dedupe?data=["Apple", "appl!e"]' --header 'Authorization: Bearer YOUR_API_KEY'
| 标头 | 描述 |
|---|---|
授权
|
[必需] 应为 Bearer access_key. 订阅后,请查看上方的"您的 API 访问密钥"。 |
无长期承诺。随时升级、降级或取消。
Dedupe端点返回一个包含匹配字符串对、相似度得分和可选去重结果的JSON对象。输出可以根据指定的配置格式化为字符串对、索引对或去重字符串
响应数据中的关键字段包括“状态”(指示成功或错误)和“响应数据”,其中包含根据用户请求格式化的结果,例如匹配对或去重字符串
用户可以通过调整“config”对象中的参数自定义请求,例如“similarity_threshold”用于匹配严格性,“remove_punctuation”用于预处理,以及“output_format”以选择所需的结果结构
响应数据组织为一个结果数组,每个条目对应一个匹配或去重字符串 根据输出格式,条目可能包括原始字符串、索引和相似度分数,方便轻松集成到工作流程中
典型的使用案例包括去重客户名单 将记录与主名单对账 清理CRM数据以及在不同数据源之间进行实体解析以确保数据的完整性和准确性
数据准确性通过先进的模糊匹配算法得以保持,这些算法考虑了常见的数据问题,如拼写错误和大小写差异。该API旨在有效处理混乱的数据,确保可靠的匹配结果
接受的参数值包括“similarity_threshold”(0到1),“remove_punctuation”(布尔值),“to_lowercase”(布尔值),“use_token_sort”(布尔值)和“top_k”(整数或“all”)。这些参数允许用户根据他们的特定需求调整匹配过程
如果去重端点返回部分或空结果,用户应检查输入数据是否存在质量问题,例如重复项过多或相似性阈值过低。调整“相似性阈值”或查看输入列表可以帮助改善结果
服务级别:
100%
响应时间:
173ms
服务级别:
100%
响应时间:
2,429ms
服务级别:
100%
响应时间:
17ms
服务级别:
100%
响应时间:
105ms
服务级别:
100%
响应时间:
3,869ms
服务级别:
100%
响应时间:
299ms
服务级别:
100%
响应时间:
219ms
服务级别:
100%
响应时间:
935ms
服务级别:
100%
响应时间:
546ms
服务级别:
100%
响应时间:
83ms
服务级别:
100%
响应时间:
179ms
服务级别:
100%
响应时间:
1,189ms
服务级别:
100%
响应时间:
958ms
服务级别:
100%
响应时间:
2,041ms
服务级别:
100%
响应时间:
152ms
服务级别:
100%
响应时间:
624ms
服务级别:
100%
响应时间:
1,173ms
服务级别:
100%
响应时间:
429ms
服务级别:
100%
响应时间:
181ms
服务级别:
100%
响应时间:
2,876ms