Harvey 在一年内将法律 AI 文件处理扩展至 26 倍

realtime news Jul 27, 2026 17:36

Harvey 的文件处理量在一年内激增 26 倍,每周达到数千万份文件,同时扩大基础设施以满足企业法律需求。关键变化揭晓。

Harvey 在一年内将法律 AI 文件处理扩展至 26 倍

根据公司在 2026 年 7 月 27 日发表的博客文章,早些时候估值达 110 亿美元的法律 AI 平台 Harvey 在过去 12 个月内实现了文件处理量惊人的 26 倍增长。该平台目前每周处理数千万份文件,凸显了其作为企业法律团队和大型律师事务所的重要工具的日益重要性。

一年前,Harvey 在繁忙的一周内处理的文件刚刚不到一百万份,消耗了 1.44 TB 的数据。而今天,该平台每周处理 2480 万份文件,相当于 56 TB 的数据。这意味着每天处理约 350 万份文件,这得益于企业采用的扩大以及与领先文档管理系统(如 iManage、SharePoint、Google Drive 和 Box)集成的增强。

增长背后的原因是什么?

Harvey 的激增部分源于其重新定位为庞大法律文件集合的核心记录系统。虽然该平台历史上主要用于单次文件上传,但企业现在越来越多地将整个文档存储库直接同步到 Harvey。处理的文件类型也变得更加多样化,包括扫描的 PDF、电子邮件存档、电子发现(eDiscovery)导出以及国际格式——所有这些都需要强大的光学字符识别(OCR)和高级数据提取功能。

为了应对这种复杂性和处理量,Harvey 重建了其文件处理管道。关键升级包括将管道分为提取、嵌入和索引等独立阶段,使每个阶段能够独立扩展。例如,OCR 密集型文件现在单独处理,以防止对系统其他部分造成瓶颈。此外,公司引入了统一文档格式(UDF)来优化中间文件处理,在不降低质量的情况下将提取延迟减少多达 19%。

基础设施创新

Harvey 的架构革新还解决了其原始向量数据库的限制,该数据库在面对当前工作负载的内存压力和批量索引时表现不佳。公司通过实时迁移过渡到新的向量存储系统,该迁移包括双写和影子读取验证,以避免停机。为了进一步降低延迟,团队用 Arrow IPC 替代了 JSON 序列化,从而简化了从嵌入到索引的流程。

在规模化运作中,Harvey 的系统经常面临 OCR 提供商速度减慢、Blob 读取超时和向量存储速率限制等挑战。公司通过阶段性容量控制、动态任务路由以及高级可观测性工具缓解这些风险,这些工具能够区分饱和的依赖项与问题文件。这确保了 Harvey 即使在突发性高负载(如数百万文件的 Vault 上传)下也能保持性能。

为什么这很重要

Harvey 的基础设施进步突出了 AI 平台在高容量、高复杂度企业工作流程中日益不可或缺的趋势。凭借超过 20 万名专业人士使用该平台以及每天处理 85 万次查询,Harvey 已将自己定位为处理尽职调查、合同分析和电子发现项目等法律团队的支柱。

公司的增长也证明了法律领域对 AI 的依赖日益增加,该领域通常需要处理庞大的数据集,同时满足严格的准确性和安全性要求。Harvey 在保持低延迟和区域合规的同时应对增长的能力,凸显了其企业级能力,这是其在竞争激烈的法律科技领域中脱颖而出的关键卖点。

展望未来,Harvey 计划增强其自动扩展能力,以将系统容量与实时需求对齐。公司还计划逐步淘汰其向量数据库迁移中使用的旧系统,这将进一步简化操作并减少暂时的内存开销。

随着企业采用率的持续攀升以及最近 2 亿美元的融资轮次,Harvey 看起来已准备好巩固其在 AI 驱动法律工作流程中的主导地位。下一个挑战将是确保其基础设施能够跟上文件处理量和客户期望的持续增长。

Image source: Shutterstock