关于大模型:法律人必知的六个基本问题

来源:网络法实务圈

文章摘要
在当今的数字时代,大型语言模型已成为技术领域的一个突破性进展,所谓的突破就在于从以往的单一应用场景下的AI变成了可以在泛化场景中使用的通用人工智能,说白了就是越来越像人。

在当今的数字时代,大型语言模型已成为技术领域的一个突破性进展,所谓的突破就在于从以往的单一应用场景下的AI变成了可以在泛化场景中使用的通用人工智能,说白了就是越来越像人。它们不仅是人工智能发展的重要里程碑,也对法律行业产生了深远的影响。
作为一名法律专业人士,理解这些模型的基本原理和潜在影响至关重要。本文将探讨大型模型的核心概念,包括其作为基于神经网络的学习算法的本质,算法的开源性和全球适用性,以及模型训练所需的大量数据和语料库的来源。我们还将深入了解多模态模型的概念、参数在这些模型中的作用,以及开源对大型模型发展的重要性。通过这些知识,法律专业人士可以更好地理解和应对在这个快速发展的领域中遇到的各种挑战和机遇。
一、一种深度学习算法
人工智能要像人一样能够思考和处理问题,首先要解决的是有学习能力,这种学习能力你可以理解为一个人的大脑或者电脑的CPU,可以用来处理很多信息和数据,并且将这些处理经验积累下来,在人工智能发展的历程中有很多种类型的解决方案,近几年被人们熟知的当属打败李世石和柯洁的围棋AI——阿尔法狗,其本质是一种学习算法,然后把大量的围棋棋谱数据丢进去学习,最后形成极高的围棋能力。
所以,大模型首先是一种学习算法,准确的讲是一种基于神经网络架构的深度学习算法。深度学习算法是指通过构建多层神经网络来学习数据特征的方法。其中,常见的深度学习算法由卷积神经网络(CNN)、循环神经网络(RNN)和变分自编码器(VAE)等,而神经网络结构则是指神经网络中节点和连接的方式,包括层级、神经元类型、激活函数等。不同的神经网络结构适用于不同的任务和数据类型。
简单理解,就是模仿了人脑的神经元构造,由无数最小的运算单元组建起一个庞大的计算网络,神经元可以接受输入参数按照一定概率输出最相关的结果,在学习算法的统一指挥下,这些神经元协同起来得出最接近实际要求的结果。
二、语料:大模型需要训练
有了深度学习算法和神经网络,就相当于人有了大脑,但光有大脑是不能解决问题的,就像小孩生下来都有大脑,但要不断的通过后天学习和训练才能掌握最终解决问题的能力。
大模型也是如此吗,需要极大的数据量来进行训练,也就是我们通常说的语料,语料库是大型语言模型训练的基础,它们包含大量文本数据,用于让模型学习语言的结构和用法。语料库的来源多种多样:
1. 互联网文本:包括网站内容、博客文章、新闻报道等。
2. 社交媒体:例如推特、脸书等平台上的帖子和评论。
3. 书籍和文献:公共领域书籍、学术论文和杂志文章。
4. 专业数据库:如法律文件、医学文献库等。
5. 用户生成内容:如论坛帖子、产品评论等。
这些语料库通常非常庞大,包含从正式文本到非正式对话的各种语言形式,帮助模型学习并理解不同的语言环境和风格。通过分析这些数据,模型能够生成更自然、更准确的语言回应。语料的质量和规模决定了大模型的质量,所以我们发现,搜索引擎和社交媒体公司通常在大模型方面有着先天优势,因为他们有着庞大的语料库。

(谷歌公司发布最新人工智能模型Gemini双子座,声称该模型在一系列智力测试中的表现优于GPT-4模型和“专家级”人类)
而当基础大模型日渐成熟之后,针对一些具体行业和应用场景(医疗、金融、法律、客服等)的垂直大模型的训练会越来越普遍,届时,这些行业中掌握着大量垂直语料的公司也必然更有优势。当然,将语料投入模型算法进行训练的成本也非常高昂,国盛证券基于参数数量和token数量估算,GPT-3训练一次的成本约为140万美元,而对于一些更大的LLM模型采用同样的计算公式,训练成本介于200万美元至1200万美元之间。今后,随着技术的提升、语料库的开源以及大模型open api接口的开放,以及云计算能力的普及,训练成本应该会降低。
三、参数:到什么程度才算“大”
我们经常看到大模型的一些发布会或者第三方评测机构在描述一个大模型有多厉害的时候,提到的一个数据指标叫做:参数。
在大型语言模型中,"参数"指的是模型在训练过程中学习的权重。这些参数帮助模型理解和生成语言。模型的参数越多,通常意味着它能更准确地理解和生成复杂的语言结构。参数的数量通常用来衡量模型的大小和复杂性,因为它们直接影响模型处理信息的能力。例如,一个具有数十亿参数的模型比只有数百万参数的模型更为复杂和强大。大型模型能够更好地理解语言的细微差别,提供更准确的预测和生成更自然的语言输出。
比如GPT-3,它有大约1750亿个参数。这些参数是模型在训练期间学习的,它们代表了模型对语言结构的理解。例如,当模型接收到一个问题时,它会利用这些参数来预测合适的答案。每个参数都是模型内部的一个微小调整点,帮助模型决定如何处理输入的数据。因此,GPT-3通过其庞大的参数集合,能够生成流畅、准确的语言回应,执行复杂的语言任务,如翻译、摘要和创造性写作。这些参数的数量和质量直接影响了模型的性能和灵活性。

一个具体的关于参数的例子可以是一个简单的神经网络,用于区分猫和狗的图像。假设这个网络有一个输入层,一个隐藏层和一个输出层。输入层接收图像的像素数据,输出层提供分类(猫或狗)。在这个模型中,每个神经元之间的连接都有一个“权重”(参数)。例如,从每个输入层神经元到每个隐藏层神经元的连接将有10,000 x 100 = 1,000,000个权重。同样地,隐藏层到输出层的连接会有100 x 2 = 200个权重。这些权重(参数)在训练期间调整,以帮助模型学习如何正确分类图像。每个权重决定了相应输入的重要性,以及如何影响最终的分类决策。在这个例子中,模型总共有1,000,200个参数。
简单理解,就像一个人去相亲,他会在脑子里预先设定一些理想的相亲对象的判断维度,例如身高、长相、人品、学历、工作、财务状况等,而且每个维度的重要程度不同,有些人更看重人品,有些人更关注能力,这就是“权重”,权重越多越精准,筛选出的相亲对象越符合他的理想人选。
四、开源:大模型快速发展的关键
许多大型模型是开源的,意味着它们的代码和训练方法可以被公众访问和修改。这种开放性促进了全球范围内的技术发展和创新。例如Meta发布的类ChatGPT开源大语言模型——Llama 2,就是一个典型的开源且允许商用的大模型(开源地址:https://github.com/facebookresearch/llama)。前面我们说大模型的两个核心是算法和数据,这两个方面都已经有了很多高质量的开源资源,使得越来越多的人可以以更低的成本参与到大模型的研发和使用中。

开源不是说可以免费随便用,通常而言开源的算法和训练数据集都有自己的开源许可条款,市面上流行着十多种不同类型的主流许可证,针对不同的场景和使用范围,很多开源条款对于哪些内容可以开源、在什么条件下开源以及是否可以投入商用等关键问题做了规定,所以在使用这些开源资源的时候,务必要对这些许可条件事先梳理清楚。
此外,开发出的大模型产品,还涉及到结合自身的实际使用需要,设定自己的使用条款,很多时候还可能要制定自己的开源策略,这些策略在制定时也要关注用到的其他开源资产所携带的开源协议。
五、多模态:越来越像人
AI在大模型之前更多的是单一交互模式下的应用,但真实的工作和生活场景下,人所要处理的信息是多种类型叠加的,例如我们读了一个很好的文章,会用声音描述给其他人进行推荐,我们看到一个好的剧本,会通过视频拍成电影等。chatGPT在早期就只是单一模式下的文字交互应用,但随着多模态模型的成熟,可以同时处理不同类型的信息,并且是交叉处理,例如接受语音输入的指令,生成对应的图片。
所以,大模型的多模态(Multimodal)本质上是能够处理和理解多种不同类型的数据输入的模型算法,这种模式在人工智能领域是一个重要的发展方向,其更接近于人类的处理信息的方式,应用场景更加不受限制,使得AI越来越接近人,后续可以在情感分析、交互式机器人等方面有更深入的应用。
最近大火的Pika就是一个典型的多模态大模型,支持文生视频的创作方式,从普通的2D动画,到实拍感的电影场景、3D动画。生成的视频质量甚至都能达到好莱坞动画电影级别。

六、“涌现”:失控的开始?
大模型的涌现能力是指当模型的规模和复杂度达到一定程度时,它们能展现出一些在训练过程中没有直接教授或预设的能力和行为。这些能力通常是通过模型处理大量数据和执行复杂任务时自然发展出来的,训练者自己也始料未及,而且也很难解释。
涌现能力有点类似一个人在某一时间顿悟或者开窍的过程,涌现的几个关键特点包括:
1. 复杂任务处理:大模型能在没有明确指示的情况下处理复杂或多步骤的任务,表现出对复杂问题的深入理解和处理能力。
2. 创造性和适应性:模型能够生成创新的解决方案,适应新的情境和问题,即使这些情况在训练数据中没有明确的例子。
3. 跨领域知识应用:模型能够将一个领域的知识和技能应用到另一个领域,展现出跨学科的理解和应用能力。
4. 强化学习与自我优化:通过持续的学习和互动,模型可以在其操作过程中不断优化自己的表现和策略。
涌现能力是AI领域非常值得关注且令人费解的一种现象,一方面这种能力使得AI不断的做出超出人类预想的创举,另一方面也引发了人们对于AI安全性和可控性的担忧,马斯克曾联合很多业内人士呼吁暂停AI的训练,可能也是这个原因,涌现能力告诉我们AI并不是百分之百处在人类控制之下的,所以后续在法律层面对AI算法的审查、安全控制等都会成为亟待研究和解决的问题。
未完待续
周鸿祎在到美国考察完大模型产业后,对媒体说:“大模型将重构所有产业”,这个观点在业内已经越来越成为共识,法律届已经有不止一家律所开始斥资开发大模型,近期有法律科技公司也融资数千万投入大模型开发,法律人有必要对大模型熟悉和了解起来。
但现实情况是,相当多数的法律人连大模型都没有亲自上手使用过,或者仅仅是简单体验,就对大模型相关的问题展开讨论和判断,笔者认为这是不严谨的,应该掌握一些基本原理并且熟练使用相关工具,在此基础上才能深度研判问题。
更进一步,法律人有必要在网络技术浪潮之下,学习和拥抱新技术,这是时代布置给所有法律人的必修课。本文作者出版了一本专门为法律人撰写的技术通识课《无技术不法律》,用简单易懂的方式介绍计算机和互联网的基本技术原理,也欢迎大家加作者微信交流更多相关话题。

技术驱动法律,专业成就未来