🎧 Listen to this article: हिंदी · English · தமிழ் · తెలుగు · ಕನ್ನಡ · മലയാളം · ଓଡ଼ିଆ · 日本語 · 中文
🌍 Read this in your language: हिंदी · தமிழ் · తెలుగు · ಕನ್ನಡ · മലയാളം · ଓଡ଼ିଆ · 日本語 · 中文
这是2026年7月3日发表在DEV Community上的一个思想实验:如果你把每一份乌克兰法院判决、每一部法律、每一个法律登记册,都喂给在Google Cloud上运行的巨型AI模型训练,你究竟会得到什么?
这并不纯粹是理论。有一个法律科技团队已经拥有了这些数据——大约2 TB的乌克兰法律数据正躺在他们的生产系统中。他们发表了一份详细的分析,说明这种训练会是什么样子、成本多少,以及生成的模型会发展出什么样的法律推理能力。
数据集:2 Terabytes 真实的法律文本
起点是真实的。该团队运营着一个名为 SecondLayer 的法律数据库,他们收集了:
- 9620万份乌克兰法院全文判决书。 他们能访问到的每一份民事、刑事、商业和行政裁决。仅判决书本身就达到1.5 TB。
- 另外 550 GB 的法律参考资料。 宪法、民法典、刑法典、诉讼法典、税法。所有法院引用和适用的立法。
- 公共登记册和结构化数据。 商业登记册、债务人名单、所有权记录。外加一个彩蛋:西班牙法律数据(法院裁决、税务指南、宪法法院判决),以便模型学习另一种语言的欧洲法律思维。
加起来:大约 2 TB 的原始文本。经过重复数据删除和清理后,缩小到大约 800 到 1000 GB。转换为“tokens”(AI模型从中学习的独立语块)后,它变成了 2800 到 3300 亿个 tokens。
作为对比:最初的 DeepSeek V3 模型(当今能力最强的 AI 系统之一)在 14.8 万亿个 tokens 上进行了训练,其中大部分是英语互联网文本。这个乌克兰法律语料库要小 50 倍。但关键在于:它是专业化的。几乎每个词都很重要。没有表情包,没有随机博客文章,没有噪音——只有几十年的法院裁决和法律学说。
为什么这个模型会与今天的AI不同
如果你现在问 GPT-4o 或 Claude Opus 4.7 关于乌克兰法律的问题,它们经常会产生幻觉。它们混淆法律条款,弄混2022年前后版本的法律,并且无法可靠地区分行政程序和民事程序。
一个在 9600 万份乌克兰法院判决上训练的模型会有所不同。它不仅仅会死记硬背事实——它将学会乌克兰法院如何 适用 法律。它将理解最高法院的决定是如何塑造下级法院的推理的。它将看到法律解释在数年和数十年中演变的模式。
因为数据集中的每一份法院判决都带有元数据标签(哪个法院、哪个法官、什么日期、引用了哪些法律条款),模型学习到了结构。它不仅仅是“某个地方有一篇关于责任的文章”——它是“根据《民法典》第611条(2020年6月17日修订版),在追偿违约金的案件中,适用以下内容……”
架构:规模扩大的 DeepSeek V3
这个思想实验使用 DeepSeek V3 作为蓝图。该模型使用了一种叫做专家混合(MoE)的技术——想象一个专业律师团队。当一个民事案件进来时,只有民法专家激活。当涉及税法时,只有税务专家发言。这节省了巨大的计算能力。
真正的 DeepSeek V3 拥有 6710 亿个参数(保存所学知识的可调整权重)。每次查询只有 370 亿个参数被激活——即只有相关的专家被激活。
假设的版本将其扩展到 8600 亿个参数,每次查询大约激活 470 亿个。它大约大 30%,拥有更多专业化的专家。为什么需要更多专家?因为乌克兰法律文本受益于极端的专业化。一位专家擅长上诉推理,另一位擅长责任纠纷,还有一位擅长税法。该模型学习了更精细的区别,而没有失去通用能力。
硬件:Google最强大的AI芯片
你无法在普通计算机上训练这么大的模型。Google Cloud Platform 提供了 TPU v5p——专为AI训练设计的专用芯片。它们每个都配备了 95 GB 的高带宽内存,并以极快的速度相互通信。
最低可行的配置: 2,048 个这样的芯片,分布在 512 台机器上。遍历所有 2800 亿个 tokens 一次将需要 3 到 4 天。对于生产模型,你至少需要 3 次遍历以真正让模型学习。因此需要 9 到 12 天的连续训练。
成本:250 万到 420 万美元
Google 按需收费大约每芯片每小时 4.20 美元,或者如果你承诺 3 年合同,则每芯片每小时 2.50 美元。在 2,048 个芯片上运行 12 天,仅训练本身就花费 250 万到 420 万美元.
还要加上 20 万到 50 万美元,用于在较小的测试模型上进行试验以及微调最终版本。此外还需要几十万美元用于在训练期间存储模型检查点。
对于一个在生产中每年服务数百万次查询的专业法律模型来说,这在经济上是站得住脚的。这是一个巨大的赌注,但对一个企业法律平台来说并不荒谬。
为什么是现在?为什么这在2026年很重要
AI 已经对许多任务变得有用,但在非英语语言的专业推理方面仍然存在空白。乌克兰企业、法院和律师在处理复杂案件时仍严重依赖人类的法律专业知识。一个在乌克兰法律上训练的模型可以改变这种状况——更快的法律检索、更好的案件预测、更容易获得的指导。
作者并不是说他们已经构建了这个模型。他们是在问:我们能吗?那将花费多少?我们将获得什么?数据存在。硬件存在。方法存在。这是一个经济问题,以及法律系统是否需要这种工具。
结论
这个思想实验之所以引人注目,是因为它基于真实的约束条件。团队有数据。Google有硬件。架构已得到验证。唯一的问题是成本、实际执行,以及专业的法律AI是否值得投资。对于目前的尖端模型难以应对的非英语法律系统来说,答案可能是肯定的。
优点
- 将比当今任何可用的通用AI更好地理解乌克兰法律
- 混合专家(MoE)架构在推理时运行成本低廉——只有相关专家激活,节省计算资源
- 能够在生产中经济地每月服务数百万次法律查询
- 不仅学习法律怎么说,还学习法院在实践中如何适用法律
- 数据集中的元数据(法院类型、法官、日期)可实现更精确的推理
- 将在专业AI稀缺的语言中推动法律技术的发展
缺点
- 极高的前期成本(仅训练就需要250万到420万美元)
- 需要大多数组织无法租用的罕见、难以获取的硬件(TPU v5p pods)
- 数据集过于垂直——大多数组织没有2 TB的法律语料库
- 模型深深专精于乌克兰法律;对一般任务的用处较小
- 用于存储和模型维护的持续基础设施成本
- 高度专业化意味着对其他司法管辖区或法律系统的泛化能力差
- 存在过度拟合单一国家法律体系的风险
警告
本文是教育性的,基于公开可用的技术信息探讨了一个假设场景。提到的任何具体数值——成本、训练时间线、模型大小、每芯片小时的定价——在依赖它们进行决策之前,都应与当前的 GCP 定价和原始来源进行核实。说明性示例中的所有占位符值必须替换为适合你的用例和环境的实际值。读者在尝试生产规模的类似项目之前,应查阅原始技术出版物、领域专家和 Google Cloud 文档。
常见问题解答
- 什么是专家混合(MoE)模型,它是如何节省计算资源的?
- 在 Google Cloud Platform 上训练一个大型 AI 模型需要多少钱?
- 为什么乌克兰法律需要一个专业的 AI 模型?
- 你能训练一个专注于特定领域(如法律)的 AI 模型吗?
- 在 MoE 模型中,总参数和活动参数有什么区别?
- 训练一个拥有数千亿个参数的模型需要多长时间?
- 一个专业的法律 AI 模型最终会取代律师吗?
- 还有哪些国家或行业可以受益于特定领域的 AI 模型?
标签
#deepseek #ai-training #llm #ukraine #legal-ai #gcp #machine-learning #moe #domain-specific-ai #ai-infrastructure
API Security Testing Checklist
A practical workflow for testing authentication, authorization, input handling, business logic, and evidence without losing track of scope.
Free. No spam — unsubscribe in one click.


Responses
Sign in to leave a response.