快速阅读: 为了充分利用生成式人工智能的优势,企业正积极探索如何将数据转化为竞争优势。然而,直接将数据库与大型语言模型连接可能会引发数据泄露、合规性和安全性方面的风险。为应对这些挑战,企业应避免直接连接数据库,转而采用查询翻译器和沙盒等措施,以确保数据隐私并提升工作效率。通过这种方式,企业可以在享受GenAI带来的益处的同时,有效规避潜在的风险。
企业想要一切,而且是现在——或者至少在几秒钟内。他们希望利用生成式人工智能(GenAI)带来的好处,例如基于数据输入的快速内容和战略建议。GenAI的采用率飙升并不奇怪。芝加哥大学的经济学家发现,超过百分之五十的员工在工作中经常使用ChatGPT,而在软件开发、市场营销和信息技术等领域,这一比例上升到约四分之三。与此同时,福瑞斯特报告称,百分之七十三的数据和分析决策者认为人工智能的使用对他们的组织产生了积极影响。为了获得GenAI驱动的洞见,许多企业选择直接将数据库与大型语言模型(LLM)连接起来。表面上看,这似乎是个好主意:他们可以基于以前无法访问的专有信息揭示新的见解,并推出能够快速回答客户问题的聊天机器人,而无需等待客服代理。目标是创建一个无缝系统,让业务线(LOB)用户无需知道如何编程、如何将问题转换为SQL查询或哪种可视化最适合他们的报告,就能获取答案。但在表面之下潜藏着许多风险。直接将数据库与公开可用的LLM连接会引发潜在的数据泄露、监管不合规、错误响应和网络安全漏洞等问题。此外,大数据库可能会使LLM变得如此缓慢,以至于对企业应用场景来说效果不佳。
企业能否在不遭受缺点的情况下利用GenAI与专有数据相结合的好处?数据隐私、合规性和安全性受损
不幸的是,公共LLM远非安全。三星因员工使用ChatGPT导致专有数据泄露而成为头条新闻。提示可能会向公司外部的用户泄露敏感数据,尤其是如果恶意行为者入侵或欺骗了LLM。更重要的是,大型LLM开发者会利用你的提示和上传来训练他们的模型。即使所有数据未被未经授权的眼睛看到,仅仅将其与云托管的LLM共享也可能违反GDPR、CCPA、HIPAA等法规关于云服务器使用的严格规定。此外,每个连接点都是网络攻击的潜在入口,包括用于LLM的API。“在我看来,隐私风险极大,”Pyramid Analytics的首席技术官兼联合创始人阿维·佩雷斯解释道。“因为你实际上是在分享你公司的核心机密信息,这些信息完全是私有的,然后你把它发送给一个公共服务,该服务托管聊天机器人并要求它进行分析。”
佩雷斯继续说道:“这里的危险是真实的。这可能使企业面临各种问题——从接收端有人嗅探问题,到托管AI LLM的供应商捕获带有数据提示的问题,再到关于LLM对数据的数学或分析响应质量的问题。”通过专门设置,可以仅共享元数据而不是直接将LLM连接到整个数据库。然后LLM处理你的问题并生成你可以运行在数据上的查询,而不暴露给未经授权的访问。这是某些高级商业智能平台采用的架构。屏蔽技术、加密和标记化也可以用来隐藏敏感变量,同时保留数据的基本模式和结构。
缓慢且低效的工作流程
许多商业客户拥有庞大的数据量,达到数百万行和数百列。许多服务甚至不允许你上传如此规模的数据集,但如果你尝试这样做,你会发现这会大幅降低系统的速度。上传所有数据可能需要几个小时。等到LLM处理完所有这些行时,数据已经过时。用LLM编写一封个性化电子邮件是一回事,但随着数据的增长,处理时间也会增加。令牌限制或配额可能会造成吞吐量瓶颈并增加延迟。用户可能需要等待几分钟才能得到答案,没有人有这么大的耐心。当然,你的客户也不愿意等待客服支持聊天机器人的即时回复。鉴于连接LLM到数据库的一个原因是提高效率和获得更有意义的洞察力,这种方法无异于适得其反。
查询翻译器提供了一种克服这一障碍的方法。这些工具可以将自然语言提示或描述转换成SQL语句。你可以审查代码,然后在自我托管的安全环境中执行查询。LLM只能看到你的查询,而不是数据,从而保护你的数据库而不牺牲实时分析。
不可靠的输出
你的数据库可能没有组织得足够好,以至于LLM无法有效地完成工作,而源应用程序可能会以LLM无法理解的方式交付数据。数据科学家可以确保所使用的数据是干净的,并且LLM能够对其进行排序,但去除这一层会导致错误。当你直接将LLM连接到未经处理的数据时,它不一定知道该怎么做。每当源应用更新时,你都需要更新LLM,并且调试将是一个永无止境的挑战。更糟糕的是,很少有LOB用户知道如何编写提示、编码查询或配置LLM。如果他们措辞不当导致产生无关的响应,他们不会意识到结果是不准确的。他们可能会使用导致LLM删除部分数据或创建不必要的性能密集型查询的措辞,从而增加成本。“输出的质量很大程度上取决于检索到的信息的相关性和质量,”Zive的斯蒂菲妮·丹克特说。“如果底层知识库组织不良或过时,LLM提供的答案可能是不准确或无关的。不幸的是,这种情况在现实中几乎总是如此,只有小公司通常能够手动保持所有内部数据和知识的有序。”
一种解决方案是应用沙盒。这是一种构建受控环境的方法,让LLM可以在样本或合成数据库上运行SQL查询,使用匿名化、聚合、占位符甚至AI生成的数据。沙盒可以模拟真实数据库,同时将你的实际数据安全地隔离在LLM之外。这是生成、测试和验证SQL查询的有效方法。即使数据被修改或未经授权的人员访问,实际风险也非常小。
LLM和数据库需要保持健康距离
确实,AI为业务分析带来了更多力量,推动了生产力,民主化了对洞见的访问,并加快了响应时间。但直接将其连接到数据库并不一定能带来你预期的额外好处。重要的是要使用工作绕过方法,在数据库和LLM之间建立安全的围栏,以便你可以在享受GenAI分析的优势的同时避免缺点。
(以上内容均由Ai生成)