浙江大学-生成式人工智能赋能智慧司法及相关思考

  • 来源:浙江大学
  • 发布时间:2025/04/07
  • 浏览次数:110
  • 举报
相关深度报告REPORTS

浙江大学-生成式人工智能赋能智慧司法及相关思考.pdf

该文档由浙江大学发布,深入探讨了生成式人工智能技术在智慧司法领域的应用潜力及潜在风险。文档主要分析了AI大模型如何赋能司法实践,包括辅助法律检索、文书生成、案例预测等场景,旨在提升司法效率与公正性。核心价值:本文档不仅梳理了生成式AI在司法场景下的技术落地路径,还针对算法偏见、数据安全、伦理合规等关键问题进行了系统性思考,为构建可信、可控的智慧司法体系提供了理论依据与实践参考,对推动法律科技(LegalTech)的发展具有重要指导意义。

1.生成式人工智能发展脉络

什么是人工智能?

人工智能(Artificial Intelligence):是以机器为载体所展示出来的人类智能,亦称为机器智能(Machine Intelligence)• 让机器模拟人类在视觉、听觉、语言和行为等方面的某些功能。

什么是生成式模型?

生成式模型

 学习“数据如何生成的”(联合概率分布) • 目标:学习数据背后的“完整故事”,包括数据的分 布规律,甚至能自己“编故事”(生成新样本)。 • 像什么:一个画家,不仅会判断“这是猫还是狗”, 还能亲手画出一只猫或狗。 • 怎么做:先分别学习猫和狗的特征(比如猫的尖耳朵、 狗的尾巴形状),然后建模它们的整体分布规律。

判别式模型

学习“如何区分数据”(条件概率或决策边界)• 目标:直接找到“区分猫狗的关键线索”,不关心数据本身如何生成。• 像什么:一个侦探,专注研究“猫和狗有什么不同”,快速抓住关键证据。• 怎么做:直接学习猫狗之间的“分界线”,不关心猫狗各自长什么样。

区分芒果和榴莲: 生成式模型:研究芒果的颜色、形状、气味,以及榴莲的尖刺、气味,甚至能“合成”一个虚拟的芒果。判别式模型:直接记住“有尖刺的是榴莲,黄色椭圆形的是芒果”,遇到水果时快速对比。

生成式人工智能技术,是指具有文本、图片、音频、视频等内容生成能力的模型及相关技术。

生成式人工智能的到来

生成式人工智能的典型代表:ChatGPT nChatGPT:大数据+超算力,现象级AI应用引发范式革命。

GPT-1(2018):开启预训练范式。核心突破:基于Transformer解码器架构,采用“无监督预训练+任务微调”的训练模式,参数1.17亿。 • 任务微调指在预训练模型的基础上,使用特定任务的数据继续训练,来优化其在目标任务上的性能。通俗来说,就是给一个“什么都会一点但不精通的通才”做专项特训。 • 能力特点:掌握基础语义规律,但生成文本较机械,像刚学会造句的小学生。

GPT-2(2019):展现零样本学习能力。规模升级:参数增至15亿,训练数据扩展至40GB网页文本。• 技术亮点:证明了无需任务微调即可完成翻译、摘要等任务,生成文本连贯且富有创意,如撰写短篇小说。 • 社会争议:因可能生成虚假信息,OpenAI一度限制其开源。

GPT-3(2020):参数爆炸与少样本学习。参数跃迁:1750亿参数创纪录,训练数据涵盖45TB互联网内容。• 能力质变: a. 少样本学习:对于一个全新的任务,只需要给其提供1-5个示范案例,AI就能根据原有知识,迅速掌握全新的技能任务 b. 通用性突破:具有卓越的语言理解能力,和一定的归纳、演绎逻辑推理能力。 • 局限性:存在“幻觉”问题,可能编造看似合理但错误的内容。

ChatGPT(2022):对话式AI的里程碑。技术革新:基于GPT-3.5,引入三阶段训练: a. 海量文本预训练:构建语言知识库; b. 人工标注示范:学习对话礼仪与安全准则; c. 人类反馈强化学习:通过人类反馈减少无益、有害输出。• 应用爆发:成为写作助手、编程导师、多语言翻译工具。

GPT-4(2023-2024):多模态与系统化思维。架构升级:参数规模上,1.8万亿参数,采用混合专家(MoE)架构提升效率;多模态融合上,支持图像输入与文本生成,如解析医学影像生成诊断报告 。 • 能力跃迁:GPT-4在美国法考、GRE、SAT等排名提升至人类考生前10%水平;在法律、医疗等垂直领域表现接近人类专家。

2.生成式人工智能赋能智慧司法

本院认为自动生成

问题:给定原告诉请和事实描述, 目标是生成法官对原告述请支持与否的文本描述 (判决及其理由) n 挑战:数据混淆偏差,因为原告只在胜诉率高时下才起诉,导致超过76%的民间借贷案件的原告诉请是被支持的n 想法:引入因果反事实模型,解决数据驱动所导致的混淆偏差。

基于法律知识的可解释性判决

问题:给定原告诉请和事实描述, 目标是预测法官对原告诉请支持与否n 挑战:数据驱动+知识指导,如何让模型学习法律判案知识n 想法:使用一阶谓词逻辑对法律知识进行编码,并将一阶谓词逻辑表达式转化为可微的、端到端训练的神经网络组成部分。

3.生成式人工智能的不能

在保持连贯的上下文语境中,对若干个单词进行有意义线性组合,从而连缀成一个会意句子;在保持合理的空间布局下,对众多图像小块进行有意义结构组合,拼合为一幅精彩图像;在保持一致的连续时空内,对一系列时空子块进行有意义时空组合,从而拼接成一段动感视频。

编辑:999感冒灵
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至