机器翻译(MachineTranslation,MT)是语言学、计算机科学及自动化技术相结合的学科,是指借助计算机把一种语言翻译成另一种语言的工程,其核心是双语言知识的计算机处理。从人工智能的角度来看,机器翻译就是模拟人对语言的接受、理解、分析,然后用另一种语言重新表达。2017年,政府发布的《国家语言文字事业“十三五”发展规划》提出支持不同语种间的机器翻译研究和技术产品研发。计算机科学、语言学(如语料库等)、人工智能的发展也为机器翻译提供了有力支持。除了政策鼓励,机器翻译也面临着语料库权属和使用、语音合成中的声音商品化、知识产权保护等方面的法律问题。
一、机器翻译概述
(一)机器翻译的发展历程
机器翻译技术的发展大致经历了萌芽、沉寂、复苏和发展四个阶段。
1946年,美国计算语言学家韦弗和英国工程师布斯提出了利用计算机进行自动翻译的想法。1954年,IBM利用计算机进行了世界上第一次机器翻译表演。1966年美国语言自动处理咨询委员会公布的《语言与机器》报告否定了机器翻译的可行性,导致机器翻译的研究一度沉寂。
直到20世纪70年代中期,随着计算机软硬件的发展,机器翻译研究开始复苏。业界研发出了Weinder、EURPOTRAA等翻译系统。1993年IBM公司研发的基于词对齐的翻译模型标志着统计机器翻译方法的诞生。2003年爱丁堡大学的Koehn提出短语翻译模型并得到广泛运用。
随着人工智能的发展,人工智能与机器翻译相结合的研究也已经开展。去年,Google公司公布了一项仅使用注意力(Attention)机制构建模型应用在机器翻译的研究,引起了广泛讨论。
(二)机器翻译的实现原理
机器翻译的工作原理是先从语言学出发建立词典和语法规则,然后运用计算机技术将该规则代码化和程序化,核心是让计算机模拟人的翻译过程。
目前,机器翻译系统主要分为基于规则(以词典、语法规则为基础)和基于语料库(以标注的语料为应用基础通过统计规律机型翻译,基于语料库的机器翻译又可以分为基于统计的和基于实例的机器翻译)两大类。
基于规则的机器翻译优点在于对知识表达的抽象程度高、对文法结构具有很强的保持能力;缺点是语法和规则由人编写,规则的一致性难以保障,而且对非规范的语言现象缺乏处理能力。
基于语料库的机器翻译优点体现在具有较强的知识自动获取能力,大规模语料训练提高系统性能,善于处理模糊的语言现象;缺点在于需要大规模双语平行语料库进行训练学习,语料的选择和处理工作量巨大。
在机器翻译的实际应用中,基本采用了基于规则和基于语料库相结合的方法。机器翻译系统的工作流程应该包括如下内容:
(1)原文输入;
(2)词法分析加工;
(3)句法分析加工;
(4)语义分析加工;
(5)百科知识加工;
(6)目标转换生成;
(7)译文输出。
在语音实时翻译的领域,在语音输入后会进行语音识别;相应地,在译文输出前会进行语音合成。机器翻译作为自然语言处理的一项应用技术,涉及人工智能、数学、语言学、计算语言学、语音识别和语音合同等多种学科和技术。
二、机器翻译发展的法律问题及应对
(一)语料库数据的归属和使用
基于语料库的机器翻译在翻译过程中引入语料库统计或实例,通过语料加工手段使语料库转化为语言知识库。近年来,基于语料库的机器翻译系统发展很快,取得了突出的成绩。
基于语料库的机器翻译需要大规模双语平行语料库进行训练学习,对语料库的质量要求较高,并且翻译模型和语言参数的精确性直接依赖于语料的多少,翻译质量的高低主要取决于概率模型的好坏和语料库的质量及其覆盖能力。机器翻译的翻译性能可通过大规模语料训练进行改善,并且可以融合更多的句法结构和语义语法信息。
另外,翻译记忆(Translation Memories)能够保存和重复使用已经翻译好的译文,保证了翻译的一致性和译文的质量,避免重复劳动降低了翻译的成本。所以,在基于语料库的机器翻译中,语料库的建设具有非常重要的地位,语料库的归属和使用也成为制约机器翻译发展的因素。
语料库的建设需要付出巨大的劳动和努力,尤其是高质量的语料在初期需要经过人工选择过滤。从目前来看,国内语料库建设主要还是依托高等院校和科研机构,也有专门的语料数据公司,还有机构通过建立众译开放平台进行语料收集及加工,目的也是为了通过多种方式建设和丰富语料库。
语料库的本质是数据,已经公布的《民法总则》确认了数据在法律中的财产地位,作为一种财产,语料库建设的过程需要注意语料库归属和使用的合法性。合法的语料库建设方式包括自行建设、合作共建、协商转让或者协商授权,通过合法方式建设的语料库能够最大程度避免机器翻译研发过程中的语料库权利瑕疵。从网上抓取,本质上属于未经许可使用他人享有合法权益的内容,将会面临法律风险。
(二)语音合成中的声音商品化权益
语音合成是通过机械的、电子的方法将文本转换成语音的技术,涉及机器对自然语言的理解、韵律处理、声音合成等环节。在机器翻译的语音产品中,翻译结果会通过语音合成技术输出。为实现语音合成的结果,需要提取特定人的声音的韵律,对合成语音的韵律进行控制;提取特定人的声音的声纹,并以声纹为基础、结合韵律进行合成。
在语音合成技术中,出现了提取特定人的声纹用于语音合成是否需要获得同意的问题。尤其对于公众人物来说,声音具有明显的识别度,容易被他人利用。在国外,一些国家或地区对声音采取明确的法律保护,如美国加州和内华达州、法国、加拿大魁北克省、我国澳门地区等。对于这种所谓的“声音权”,我国法律并无明文规定,有学者认为可以通过一般人格权、设立声音权、形象权或者商品化权等方式进行保护,该问题目前仅在理论探讨阶段,司法实践中也还未出现相关案例。
虽然在通过何种方式进行保护的问题上存在争议,但是学者们都一致认为有必要对声音进行法律保护。在产品中,如果需要使用名人的声音,应当通过合同获得授权;如果是合成语音的,应当为了避免因语音合成与名人声音相似。
(三)建立专利保护及技术标准
随着产业发展,语言信息处理的机器翻译技术国际化的总体需求形成。对技术成果申请专利进行保护,进而建立起相应的技术标准是国际上普遍的做法。
在人工智能领域,欧盟已经提出在各成员国内部建立统一的技术标准用以指导人工智能的发展和应用,避免欧盟市场内部的分裂和重复建设。美国也出台了《为未来人工智能做好准备》和《国家人工智能研究与发展战略规划》报告中,提出统一技术、数据使用、安全等标准建设,避免造成各个参与者封闭建设的问题,影响人工智能研发和应用。
Google、Facebook、IBM、微软和亚马逊已经在尝试联合制定关于人工智能的一系列标准。在机器翻译技术上处于领先地位的公司已经将技术转化为专利,目前基于统计的机器翻译有多达数百项的专利技术,神经网络机器翻译要达到相同的质量,同样需要相当多的研究成果,比如Google申请了关于神经机器关键字处理翻译系统的专利。
统一技术标准、数据使用标准、安全保障标准等标准化建设将会是未来机器翻译发展的方向。因此,将技术专利化的同时注意避免专利侵权,参与技术标准讨论,是未来的道路。
(四)个人信息保护
按照《个人信息安全规范》的规定,以电子或者其他方式记录的能够单独或者与其他信息结合识别特定自然人身份或者反映特定自然人活动情况的各种信息。在机器翻译的信息收集、存储、使用过程中需要建立相应的保护措施,不得违反涉及隐私和数据保护的基本原则。
我国《网络安全法》《民法总则》等法律法规对加强用户个人信息保护的问题进行了专门规定,网络服务提供者在提供服务的过程中收集、使用用户个人信息,应当遵循合法、正当、必要的原则,不得收集与提供服务所必需以外的用户个人信息或者将信息用于提供服务之外的目的,不得以欺骗、误导或者强迫等方式收集、使用用户个人信息。
在行业实践中,已经有一些翻译公司因个人信息的问题受到舆论关注。去年,挪威新闻机构NRK报道了挪威国家石油公司(Statoil)因使用在线翻译工具(translate.com)而导致的数据泄露事件。Translate.com网站在提供翻译服务时,会将文件编入搜索引擎的索引,可供任何人公开查找。
从保护用户个人信息的角度,在提供机器翻译服务的过程中应当避免收集用户的个人信息,因为服务内容本身不具备收集用户个人信息的必要性。需要获得用户的翻译结果丰富语料库的,经加工处理后无法识别到用户的,在经过用户同意后可以获取。
另外,也有人提出,随着设备硬件能力的提升,可以考虑将机器翻译系统中具体负责翻译过程的模块从服务器放置于客户端,翻译的运算过程将在客户端进行,避免上传至服务器,可以降低个人信息泄露的风险。
三、总结
在全球化发展的快速进程中,机器翻译技术正在逐步改变人们的工作和生活方式。机器翻译能随时随地帮助我们解决语言障碍,让语言不通的人们自由交流。关于机器翻译发展需要面对的法律问题也开始显露出来,现行的法律制度能否提供满足机器翻译发展所需要的框架,值得继续关注。
唐伟:机器翻译的法律问题思考
作者:唐伟来源:网络法实务圈

机器翻译(MachineTranslation,MT)是语言学、计算机科学及自动化技术相结合的学科,是指借助计算机把一种语言翻译成另一种语言的工程,其核心是双语言知识的计算机处理。