1. 创业头条
  2. 前沿领域
  3. 人工智能
  4. 正文

开发框架与基础硬件携手,AI的社会价值在文化领域深度彰显

 2023-01-13 13:14  来源:A5专栏  我来投稿 撤稿纠错

  【推荐】海外独服/站群服务器/高防

语言是人类进行沟通交流的表达方式,其储存着丰富的文化信息,传承着民族血脉,也支撑着文明的发展与演进。然而,一些少数民族语言、方言却正在无声无息地消失,与之密切相连的地域文化、历史文化也正面临濒危风险。

“大约平均两周就会有一种语言消亡“,联合国教科文组织的这一调查数据让人触目惊心,且世界上正在使用的约6,000种语言,至少有43%面临濒危[1]。而在中国,也有25种语言使用人口已不足千人[2]。

抢救濒危少数民族语言对保持汉语的丰富性、多元性,保护文化记忆、文化基因意义重大。因此,中国早在2015年就启动了语言资源保护工程,借助田野调查,建立起庞大的口语语料库,保存了原始声音文件和国际音标标注等丰富素材。

[1] 如欲了解更多详情请访问:https://www.un.org/zh/observances/mother-language-day%20

[2]如欲了解更多详情请访问:https://epaper.gmw.cn/zhdsb/html/2022-01/19/nw.D110000zhdsb_20220119_1-06.htm

然而,仅仅依靠这些单语数据,研究者难以获知其背后所传达的语义,无法有效开展相关学习与研究,更罔论留存这些少数民族濒危语言与背后地方文化的生命力。

人工智能技术为复活这些语言,挖掘多元文化价值,传承璀璨的历史文化,提供了新思路和新手段。2022年国际母语日也将“利用技术促进多语言学习:挑战与机遇”作为主题,指出了技术对推进多语言教育以及文化传承与保护的作用。

百度飞桨深度学习平台携手英特尔,基于第三代英特尔® 至强® 可扩展处理器进行深度优化,通过完善的模型压缩方法和量化加速技术,支持全自动生成大规模“汉语-少数民族语言”双向词典,对用技术帮助保护濒危少数民族语言,推动民族互通互融,做出了积极探索,展现了“科技向善”的现实意义和历史价值。

采用百度飞桨深度学习平台,全自动构建大规模双向词典

构建双向词典项目,采用了规模大、范围广、语种多、内容丰富的濒危语言博物馆馆藏源语料库,语料全部来自于田野调查与实地采集。

通过分析,项目研发人员选取了中国少数民族语言中的独龙、尔苏、嘉绒、撒拉这四种数据较为丰富的语言作为实验对象。

为基于百度飞桨实现对齐算法,项目团队首先开发了民间故事汉语数据集。开发过程中,充分利用飞桨PaddleOCR开发套件识别精度高、推理速度快等特性,对跨度8年的《故事会》杂志扫描样本进行数据化处理,构建出规模达950万字的文本数据集,也是全球首个民间故事汉语数据库,且具有很强的口语化风格,适合与少数民族语言语料进行对齐。

然后,实施低资源词向量训练,应对四个少数民族语料句子数量普遍不足五千条的挑战,以及《故事会》语料小于二十万条句子的问题,为下游的双语对齐提供了强有力的支持。

继之,依据拓扑特征,对两种语言的词向量进行旋转和对齐,实施双语词典自动化抽取,最终导出了独龙、尔苏、嘉绒、撒拉这四种语言和汉语的双向词典。

目前,这四部双向词典已在中国社科院民族学和人类学研究所志愿者的协助下,进行了内部评测,仅发现含有少量误差。这一可喜成果,验证了基于百度飞桨深度学习平台,智能生成大规模汉语-少数民族语言词典的可行性和便捷性,展现了人工智能对于应对语言濒危日益严峻挑战的高效性和高价值。

英特尔与百度飞桨软硬协同优化,用智能探索文化保护新路

双向词典项目依托飞桨深度学习技术,高效实现了濒危语言词典的自动化生成,极大减轻了语保工作者的负担。而其背后是英特尔所提供的英特尔® 至强® 可扩展平台具备的强劲算力和多种优化措施,为飞桨平台高效支撑项目运作提供了基础能力和量化加速。

业界尽知,人工智能应用不仅需要高算力作为支撑,而且源于大多数深度学习模型使用32位浮点精度(FP32)构建,复杂度高,模型参数量大,限制了其在一些场景和设备进行部署,需要实施软硬结合优化,才能突破性能瓶颈,高效承载诸如上文双向词典生成等多类应用。

针对上述问题,英特尔携手百度飞桨,基于第三代英特尔® 至强® 可扩展处理器、英特尔® oneAPI工具套件等软硬件组合,在为飞桨平台提供充裕算力的同时,也对整个深度学习流程实施全方位优化,帮助加速各类应用开发和量化部署。

第三代英特尔® 至强® 可扩展处理器依托出色的微架构,发挥多核心、多线程和大容量高速缓存等特性,很好地满足了飞桨平台对通用算力的苛刻需求,同时加持以其内置的英特尔® AVX-512提供的增强矢量处理能力,提升AI 推理和训练效率,为图像分类、自然语言处理、语音识别、语音翻译等广泛的应用开发和部署提供稳健基石。而最新一代的第四代英特尔® 至强® 可扩展处理器更内置一系列加速器,包括全新的AI加速器——英特尔®高级矩阵扩展(英特尔®AMX),覆盖包括训练和微调在内的更多深度学习使用场景,可以为不断变化且要求日益增高的应用提供更为可观的计算性能。

为满足模型快速“瘦身”之需,百度飞桨打造了PaddleSlim深度学习模型压缩工具库,以及为用户提供灵活的压缩策略,而英特尔® 至强® 可扩展处理器内置的AI加速技术--英特尔® 深度学习加速(英特尔® DL Boost),可通过矢量神经网络指令(VNNI)充分提高计算资源和缓存的利用率,减少潜在的带宽瓶颈,为INT8等低精度计算提供优化支持,显著加速AI 推理。由此,帮助飞桨PaddleSlim所支持的量化训练和静态离线量化方法,更好地适用于计算机视觉(CV)和自然语言处理 (NLP)等模型优化过程,这无疑也为双向词典AI方案的开发提供了便利,同时提高了项目运作效率。

同时为激活 VNNI 加速功能,百度飞桨深度学习平台在量化方案实施中还广泛使用英特尔® oneAPI 工具套件,如英特尔® oneAPI 深度神经网络库 (Intel® oneAPI Deep Neural Network Library,英特尔® oneDNN)。借助其统一、简化的编程模型,飞桨用户得以在CPU、GPU和FPGA等不同的架构上方便地调用通用接口来使用平台内置的AI加速技术,而无需担心平台兼容问题。

得益于英特尔® 至强® 可扩展平台与多项优化工具的支持,百度飞桨深度学习平台实现了深度优化,并不断丰富模型资源及应用开发套件,为用户提供了优异的模型及硬件加速体验。而双向词典项目在推动少数民族语言保护领域展现的神奇魔力,就是其典型案例。

“十四五”规划把“强化重要文化和自然遗产、非物质文化遗产系统性保护、推动中华优秀传统文化创造性转化、创新性发展”,作为提高社会文明程度的重要举措;今年的工作报告也强调了“传承中华优秀传统文化,满足人民日益增长的精神文化需求”,对铸就文化新辉煌的重要作用。

英特尔携手百度飞桨践行“科技向善”,优化开源平台,促进濒危语言保护,不仅延续和发扬了语言背后蕴含的文化、知识遗产及其价值,更探索出智能技术赋能的新路;也是英特尔继用人工智能助力长城修缮,通过计算、存储、网络全栈优化解决方案帮助云冈石窟文物保护等,持续展现创新技术对挖掘与传承璀璨历史文化、实现创新创造的新动能的又一成功实践,有助于在让历史智慧照进未来,让宝贵文化遗产丰富人们精神世界的同时,进一步加速人工智能的拓展应用,助力拥抱数字化浪潮,创造更美好的生活。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关标签
ai技术

相关文章

  • 汇聚中国AI顶尖力量 云天励飞参与华为AI大模型联合创新

    2023年7月6日,第六届世界人工智能大会(WAIC2023)在上海开幕,“人工智能大模型”是本届大会的备受瞩目的话题,据悉,在昇腾AI大模型的创新研发中,华为联手26家行业领军企业,组建了一支协同创新的“AI明星队”,云天励飞作为中国人工智能企业的杰出代表,和互联网大厂、运营商、科研院所等优秀团队

    标签:
    ai技术
  • 用友大易:迈入AI招聘2.0时代,让人力资源回归本质

    这几个月来,以ChatGPT为代表的生成式AI展现出的能力令世界惊叹。自从2016年AlphaGo战胜李世石掀起了一波AI浪潮后,AI仿佛已经沉寂了很久,ChatGPT的横空出世就如同一束耀眼的光芒,让AI这个名词重回C位。过去在AI1.0时代,主要通过训练模型来实现图像识别、声音识别、语言处理等特

    标签:
    ai技术
  • 新发布的PaaS2.0,能否助力涂鸦智能再起飞?

    文:互联网江湖作者:志刚2023年的IoT需要一个新故事。6月29日,涂鸦智能在开发者大会上,发布了企业级战略PaaS2.0,希望通过一个平台+四大开发服务,建立起IoT生态。对于这场发布会,市场的态度是积极的。美东时间6月29日收盘,涂鸦智能美股股价上涨5.6%,来到1.87美元/股。近日股价稳定

    标签:
    ai技术
  • 大模型难掩AI制药的悲伤:越过山丘,无人等候

    美团曾经的二号人物王慧文对标OpenAI的创业项目光年之外,以20亿卖给美团,再度引发市场对大模型的热议。

    标签:
    ai技术
  • 拾起王慧文的AI梦,美团冲向“光年之外”?

    2020年底,王慧文在朋友圈写下这句话时,外界本以为这位伴随中国互联网发展而持续创业20年的人物即将告别创业舞台。但是,一个曾经多次创业,正值壮年的互联网老将心中的创业热情是难以熄灭的。

    标签:
    ai技术
  • 竞逐智能家居大模型:美的“蓄力”,海尔“疾行”

    随着ChatGPT火热出圈,AI大模型便成为了各行各业必争的高地。

    标签:
    智能家居
  • 李彦宏新目标,押注AI原生应用

    文/道哥“未来,自然语言将成为新的通用编程语言。你只要会说话,就可以成为一名开发者,用自己的创造力改变世界。”4月16日,百度创始人、董事长兼首席执行官李彦宏在Create2024百度AI开发者大会上表述了对未来AI人工智能发展的新一轮展望。自OpenAI发布ChatGPT大模型后,这股AI人工智能

    标签:
    李彦宏
  • AI算力竞赛加速散热技术变革,液冷方案获行业青睐

    进入AIGC时代,智算中心规模日渐庞大,服务器能耗与日俱增。如何降低智算中心能耗已成为国家和地方政府关注的焦点。工信部数据显示,2022年全国数据中心总耗电量约2700亿千瓦时。当前,大部分数据中心仍主要采用风冷散热技术,在单柜密度、PUE值方面已愈发难以满足行业发展及绿色节能方面的要求,而冷板式液

  • 中国AIGC最值得关注企业&产品榜单揭晓!首份应用全景图谱发布

    “你好,新应用!”站在大模型落地元年,是时候喊出这句话了。从软件APP、智能终端乃至具身智能等等,AIGC开始席卷一切。大模型玩家、互联网巨头、终端厂商、垂直场景玩家纷纷入场,办公、创作、营销、教育、医疗领域相继被渗透……一个万亿市场,正在酝酿。站在浪潮起点,当下发展究竟如何了?机遇在哪?挑战如何?

  • 标准引领促转型 提升新质生产力——2024数字教育标准创新应用研讨会召开

    4月14日,以“标准引领促转型,提升新质生产力”为主题,由全国信息技术标准化技术委员会教育技术分技术委员会主办,锐捷网络承办的2024数字教育标准创新应用研讨会暨《高等学校数字校园建设规范(试行)》(以下简称《规范》)优秀及典型应用案例的颁奖活动在福州举办。本次会议聚焦赋能新质生产力和高校教育数字化

  • 两座超大城市对“视”联手 杭深奏响智能物联产业合鸣!

    春至岭南花似锦,出门俱是看花人。4月16日,2024“中国视谷”城市(深圳)推介会暨智能物联产业合作发展论坛在深圳举行。一场广聚全球英才的产业思想盛宴就像早春的花潮,召示着智能物联产业合作发展的丰硕成果正在孕育、成长。站在时代的风口和机遇中瞭望,智能物联产业是人工智能和物联网融合与应用的战略性新兴产

  • AI提高效率:用智谱清言打造爆款视频号

    关注卢松松,会经常给你分享一些我的经验和观点。(1)想做副业、短视频的同学,看完本文一定对你有所帮助!(2)很多人说2024是视频号红利的一年,有分成收益,广告主也多,流量大。(3)松松一共做了10多个视频号,在视频号布局3年了,几乎啥都做过,有的收益千八百、有的收益1-2k,有的收益3-5k。(4

    标签:
    ai技术
  • CPU上跑AI?从推荐系统的演进看CPU的崛起

    在信息和数据极度繁荣的当下,人工智能正在通过各种方式影响着人类生活。其中,AI推荐系统作为互联网时代最关键的伴生技术之一,正在帮助人类梳理着各种纷繁杂乱的信息,让资源实现更精准的调配,让一切变得井然有序。推荐系统:数字营销的重要引擎当你到一座旅游城市,不知道当地有什么美食时,AI推荐系统在手机上的本

  • 李彦宏放话:百度AI大模型绝不抢开发者饭碗

    关注卢松松,会经常给你分享一些我的经验和观点。昨晚,李彦宏内部讲话称:AI大模型开源意义不大,百度绝不抢开发者饭碗。但你一定要说话算话哦,可千万别说:“我永远不做手机,谁再敢提做手机就给我走人”,结果5年后自己的手机销量排名第一。如果百度也这么干的话估计AI也没人用了。李彦宏认为:从商业模式的角度来

    标签:
    大模型
  • 具身智能潮起、巨头环伺之下,优必选如何撑起资本期待?

    AI大模型风口之下,作为“具身智能”最佳载体,人形机器人似乎即将迎来“觉醒元年”。前有马斯克巨大影响力加持之下的人形机器人Optimus亮相,后有OpenAI联合人形机器人初创公司Figure推出令人惊艳的Figure01。可以看出,AI软件和机器人硬件的结合,已经是当下科技界一大风口。乘着这样的东

编辑推荐