语言是人类进行沟通交流的表达方式,其储存着丰富的文化信息,传承着民族血脉,也支撑着文明的发展与演进。然而,一些少数民族语言、方言却正在无声无息地消失,与之密切相连的地域文化、历史文化也正面临濒危风险。
“大约平均两周就会有一种语言消亡“,联合国教科文组织的这一调查数据让人触目惊心,且世界上正在使用的约6,000种语言,至少有43%面临濒危[1]。而在中国,也有25种语言使用人口已不足千人[2]。
抢救濒危少数民族语言对保持汉语的丰富性、多元性,保护文化记忆、文化基因意义重大。因此,中国早在2015年就启动了语言资源保护工程,借助田野调查,建立起庞大的口语语料库,保存了原始声音文件和国际音标标注等丰富素材。
[1] 如欲了解更多详情请访问:https://www.un.org/zh/observances/mother-language-day%20
[2]如欲了解更多详情请访问:https://epaper.gmw.cn/zhdsb/html/2022-01/19/nw.D110000zhdsb_20220119_1-06.htm
然而,仅仅依靠这些单语数据,研究者难以获知其背后所传达的语义,无法有效开展相关学习与研究,更罔论留存这些少数民族濒危语言与背后地方文化的生命力。
人工智能技术为复活这些语言,挖掘多元文化价值,传承璀璨的历史文化,提供了新思路和新手段。2022年国际母语日也将“利用技术促进多语言学习:挑战与机遇”作为主题,指出了技术对推进多语言教育以及文化传承与保护的作用。
百度飞桨深度学习平台携手英特尔,基于第三代英特尔® 至强® 可扩展处理器进行深度优化,通过完善的模型压缩方法和量化加速技术,支持全自动生成大规模“汉语-少数民族语言”双向词典,对用技术帮助保护濒危少数民族语言,推动民族互通互融,做出了积极探索,展现了“科技向善”的现实意义和历史价值。
采用百度飞桨深度学习平台,全自动构建大规模双向词典
构建双向词典项目,采用了规模大、范围广、语种多、内容丰富的濒危语言博物馆馆藏源语料库,语料全部来自于田野调查与实地采集。
通过分析,项目研发人员选取了中国少数民族语言中的独龙、尔苏、嘉绒、撒拉这四种数据较为丰富的语言作为实验对象。
为基于百度飞桨实现对齐算法,项目团队首先开发了民间故事汉语数据集。开发过程中,充分利用飞桨PaddleOCR开发套件识别精度高、推理速度快等特性,对跨度8年的《故事会》杂志扫描样本进行数据化处理,构建出规模达950万字的文本数据集,也是全球首个民间故事汉语数据库,且具有很强的口语化风格,适合与少数民族语言语料进行对齐。
然后,实施低资源词向量训练,应对四个少数民族语料句子数量普遍不足五千条的挑战,以及《故事会》语料小于二十万条句子的问题,为下游的双语对齐提供了强有力的支持。
继之,依据拓扑特征,对两种语言的词向量进行旋转和对齐,实施双语词典自动化抽取,最终导出了独龙、尔苏、嘉绒、撒拉这四种语言和汉语的双向词典。
目前,这四部双向词典已在中国社科院民族学和人类学研究所志愿者的协助下,进行了内部评测,仅发现含有少量误差。这一可喜成果,验证了基于百度飞桨深度学习平台,智能生成大规模汉语-少数民族语言词典的可行性和便捷性,展现了人工智能对于应对语言濒危日益严峻挑战的高效性和高价值。
英特尔与百度飞桨软硬协同优化,用智能探索文化保护新路
双向词典项目依托飞桨深度学习技术,高效实现了濒危语言词典的自动化生成,极大减轻了语保工作者的负担。而其背后是英特尔所提供的英特尔® 至强® 可扩展平台具备的强劲算力和多种优化措施,为飞桨平台高效支撑项目运作提供了基础能力和量化加速。
业界尽知,人工智能应用不仅需要高算力作为支撑,而且源于大多数深度学习模型使用32位浮点精度(FP32)构建,复杂度高,模型参数量大,限制了其在一些场景和设备进行部署,需要实施软硬结合优化,才能突破性能瓶颈,高效承载诸如上文双向词典生成等多类应用。
针对上述问题,英特尔携手百度飞桨,基于第三代英特尔® 至强® 可扩展处理器、英特尔® oneAPI工具套件等软硬件组合,在为飞桨平台提供充裕算力的同时,也对整个深度学习流程实施全方位优化,帮助加速各类应用开发和量化部署。
第三代英特尔® 至强® 可扩展处理器依托出色的微架构,发挥多核心、多线程和大容量高速缓存等特性,很好地满足了飞桨平台对通用算力的苛刻需求,同时加持以其内置的英特尔® AVX-512提供的增强矢量处理能力,提升AI 推理和训练效率,为图像分类、自然语言处理、语音识别、语音翻译等广泛的应用开发和部署提供稳健基石。而最新一代的第四代英特尔® 至强® 可扩展处理器更内置一系列加速器,包括全新的AI加速器——英特尔®高级矩阵扩展(英特尔®AMX),覆盖包括训练和微调在内的更多深度学习使用场景,可以为不断变化且要求日益增高的应用提供更为可观的计算性能。
为满足模型快速“瘦身”之需,百度飞桨打造了PaddleSlim深度学习模型压缩工具库,以及为用户提供灵活的压缩策略,而英特尔® 至强® 可扩展处理器内置的AI加速技术--英特尔® 深度学习加速(英特尔® DL Boost),可通过矢量神经网络指令(VNNI)充分提高计算资源和缓存的利用率,减少潜在的带宽瓶颈,为INT8等低精度计算提供优化支持,显著加速AI 推理。由此,帮助飞桨PaddleSlim所支持的量化训练和静态离线量化方法,更好地适用于计算机视觉(CV)和自然语言处理 (NLP)等模型优化过程,这无疑也为双向词典AI方案的开发提供了便利,同时提高了项目运作效率。
同时为激活 VNNI 加速功能,百度飞桨深度学习平台在量化方案实施中还广泛使用英特尔® oneAPI 工具套件,如英特尔® oneAPI 深度神经网络库 (Intel® oneAPI Deep Neural Network Library,英特尔® oneDNN)。借助其统一、简化的编程模型,飞桨用户得以在CPU、GPU和FPGA等不同的架构上方便地调用通用接口来使用平台内置的AI加速技术,而无需担心平台兼容问题。
得益于英特尔® 至强® 可扩展平台与多项优化工具的支持,百度飞桨深度学习平台实现了深度优化,并不断丰富模型资源及应用开发套件,为用户提供了优异的模型及硬件加速体验。而双向词典项目在推动少数民族语言保护领域展现的神奇魔力,就是其典型案例。
“十四五”规划把“强化重要文化和自然遗产、非物质文化遗产系统性保护、推动中华优秀传统文化创造性转化、创新性发展”,作为提高社会文明程度的重要举措;今年的工作报告也强调了“传承中华优秀传统文化,满足人民日益增长的精神文化需求”,对铸就文化新辉煌的重要作用。
英特尔携手百度飞桨践行“科技向善”,优化开源平台,促进濒危语言保护,不仅延续和发扬了语言背后蕴含的文化、知识遗产及其价值,更探索出智能技术赋能的新路;也是英特尔继用人工智能助力长城修缮,通过计算、存储、网络全栈优化解决方案帮助云冈石窟文物保护等,持续展现创新技术对挖掘与传承璀璨历史文化、实现创新创造的新动能的又一成功实践,有助于在让历史智慧照进未来,让宝贵文化遗产丰富人们精神世界的同时,进一步加速人工智能的拓展应用,助力拥抱数字化浪潮,创造更美好的生活。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
2023年7月6日,第六届世界人工智能大会(WAIC2023)在上海开幕,“人工智能大模型”是本届大会的备受瞩目的话题,据悉,在昇腾AI大模型的创新研发中,华为联手26家行业领军企业,组建了一支协同创新的“AI明星队”,云天励飞作为中国人工智能企业的杰出代表,和互联网大厂、运营商、科研院所等优秀团队
这几个月来,以ChatGPT为代表的生成式AI展现出的能力令世界惊叹。自从2016年AlphaGo战胜李世石掀起了一波AI浪潮后,AI仿佛已经沉寂了很久,ChatGPT的横空出世就如同一束耀眼的光芒,让AI这个名词重回C位。过去在AI1.0时代,主要通过训练模型来实现图像识别、声音识别、语言处理等特
文:互联网江湖作者:志刚2023年的IoT需要一个新故事。6月29日,涂鸦智能在开发者大会上,发布了企业级战略PaaS2.0,希望通过一个平台+四大开发服务,建立起IoT生态。对于这场发布会,市场的态度是积极的。美东时间6月29日收盘,涂鸦智能美股股价上涨5.6%,来到1.87美元/股。近日股价稳定
2020年底,王慧文在朋友圈写下这句话时,外界本以为这位伴随中国互联网发展而持续创业20年的人物即将告别创业舞台。但是,一个曾经多次创业,正值壮年的互联网老将心中的创业热情是难以熄灭的。
四个月前邀请码炒至10万元,如今官网变灰、社交账号清空,这家AI新贵的闪电迁移折射中国科技企业出海潮涌。7月11日,打开Manus官网的用户发现一则突兀提示:“Manus在你所在的地区不可用”。而就在不久前,这个位置还显示着“Manus中文版本正在开发中”的乐观声明。同时,Manus官方微博和小红书
文/十界来源/节点财经一场围绕算力自主的竞赛,正在科创板上演。近日,国产全功能GPU厂商摩尔线程递交科创板招股书,拟募资约80亿人民币,成为今年上半年科创板拟募资规模最大的冲刺者,也打响了“国产英伟达”上市的第一枪。据招股书显示,摩尔线程自2020年成立以来,主营全功能GPU芯片的研发与销售,以自主
“AI大模型六小虎”百川智能危机重重。这是前搜狗CEO王小川创办的AI公司。昨天就爆出新闻,百川智能的联合创始人离职,这是王小川入局AI的第一道大坎。接下的成败非常关键:(1)拿下河北(2)学习科大讯飞百川智能离职高端概览:(1)2025年7月10日,百川智能技术联合创始人谢剑将离职。他是百川只能的
百度AI团队今日正式推出PaddleOCR3.1版本,以突破性的多语言组合识别(MultilingualCompositionPerception,MCP)技术为核心,彻底重构复杂文档处理边界。此次升级标志着OCR领域首次实现对同一文档内任意混合语言文本的精准识别,为全球化企业、跨境业务及多元文化场
“宇树已形成硬件、算法、场景联动的业务飞轮,自研率超95%的技术壁垒让其成为全球机器人赛道不可忽视的中国力量。”首程资本管理合伙人朱方文在追加投资时如是评价。7月7日,据每日经济新闻从宇树科技投资方处获悉,国内人形机器人领军企业宇树科技(UnitreeRobotics)已明确计划于科创板IPO,预计
推理与多模态的终极融合,将彻底终结用户在不同模型间切换的烦恼。7月7日,OpenAI正式确认将在今年夏季推出新一代人工智能模型GPT-5。这一突破性产品将整合现有的多个强大模型,特别是融合专注推理能力的“O系列”与具备多模态功能的“GPT系列”,为用户提供前所未有的统一体验。OpenAI开发者体验负
高考一结束,忙坏了海内外一众大模型。豆包、DeepSeek、ChatGPT、元宝、文心一言、通义千问……掀起了一波“AI赶考”大战。据悉,去年高考期间,大模型的成绩才勉强过一本线,今年集体晋升985。据悉,豆包甚至过了清北的录取线。头部大模型在高考“考场”上玩得不亦乐乎,中小AI创企的处境却日益尴尬
文/二风来源/节点财经每年高考成绩放榜后,数千万考生和家长将迎来另一场硬仗——填报志愿。今年,这一领域迎来了AI的全面介入,多家互联网大厂和教育公司纷纷推出智能志愿填报产品,为考生提供院校和专业选择建议。据艾媒咨询数据,2023年中国高考志愿填报市场付费规模约9.5亿元,近九成考生愿意借助志愿填报服
苹果还没从WWDC25的“群嘲”中走出,又迎来了一次新的痛击。据路透社报道,21日,苹果公司遭到股东集体起诉,被指在信息披露中低估了将先进生成式AI整合进语音助手Siri所需的时间,导致iPhone销量受影响、股价下滑,构成证券欺诈。在这份诉讼中,库克、首席财务官凯文·帕雷克及前首席财务官卢卡·马埃
华为的盘古大模型终于推出新版本了。6月20日华为云计算CEO张平安宣布基于CloudMatrix384超节点的新一代昇腾AI云服务全面上线,盘古大模型5.5同步发布。不过,当前国内的AI大模型竞争可谓是相当激烈,华为的盘古大模型在众多大模型中并不是十分出众。华为云此次重磅推出的盘古大模型5.5能否从