语言是人类进行沟通交流的表达方式,其储存着丰富的文化信息,传承着民族血脉,也支撑着文明的发展与演进。然而,一些少数民族语言、方言却正在无声无息地消失,与之密切相连的地域文化、历史文化也正面临濒危风险。
“大约平均两周就会有一种语言消亡“,联合国教科文组织的这一调查数据让人触目惊心,且世界上正在使用的约6,000种语言,至少有43%面临濒危[1]。而在中国,也有25种语言使用人口已不足千人[2]。
抢救濒危少数民族语言对保持汉语的丰富性、多元性,保护文化记忆、文化基因意义重大。因此,中国早在2015年就启动了语言资源保护工程,借助田野调查,建立起庞大的口语语料库,保存了原始声音文件和国际音标标注等丰富素材。
[1] 如欲了解更多详情请访问:https://www.un.org/zh/observances/mother-language-day%20
[2]如欲了解更多详情请访问:https://epaper.gmw.cn/zhdsb/html/2022-01/19/nw.D110000zhdsb_20220119_1-06.htm
然而,仅仅依靠这些单语数据,研究者难以获知其背后所传达的语义,无法有效开展相关学习与研究,更罔论留存这些少数民族濒危语言与背后地方文化的生命力。
人工智能技术为复活这些语言,挖掘多元文化价值,传承璀璨的历史文化,提供了新思路和新手段。2022年国际母语日也将“利用技术促进多语言学习:挑战与机遇”作为主题,指出了技术对推进多语言教育以及文化传承与保护的作用。
百度飞桨深度学习平台携手英特尔,基于第三代英特尔® 至强® 可扩展处理器进行深度优化,通过完善的模型压缩方法和量化加速技术,支持全自动生成大规模“汉语-少数民族语言”双向词典,对用技术帮助保护濒危少数民族语言,推动民族互通互融,做出了积极探索,展现了“科技向善”的现实意义和历史价值。
采用百度飞桨深度学习平台,全自动构建大规模双向词典
构建双向词典项目,采用了规模大、范围广、语种多、内容丰富的濒危语言博物馆馆藏源语料库,语料全部来自于田野调查与实地采集。
通过分析,项目研发人员选取了中国少数民族语言中的独龙、尔苏、嘉绒、撒拉这四种数据较为丰富的语言作为实验对象。
为基于百度飞桨实现对齐算法,项目团队首先开发了民间故事汉语数据集。开发过程中,充分利用飞桨PaddleOCR开发套件识别精度高、推理速度快等特性,对跨度8年的《故事会》杂志扫描样本进行数据化处理,构建出规模达950万字的文本数据集,也是全球首个民间故事汉语数据库,且具有很强的口语化风格,适合与少数民族语言语料进行对齐。
然后,实施低资源词向量训练,应对四个少数民族语料句子数量普遍不足五千条的挑战,以及《故事会》语料小于二十万条句子的问题,为下游的双语对齐提供了强有力的支持。
继之,依据拓扑特征,对两种语言的词向量进行旋转和对齐,实施双语词典自动化抽取,最终导出了独龙、尔苏、嘉绒、撒拉这四种语言和汉语的双向词典。
目前,这四部双向词典已在中国社科院民族学和人类学研究所志愿者的协助下,进行了内部评测,仅发现含有少量误差。这一可喜成果,验证了基于百度飞桨深度学习平台,智能生成大规模汉语-少数民族语言词典的可行性和便捷性,展现了人工智能对于应对语言濒危日益严峻挑战的高效性和高价值。
英特尔与百度飞桨软硬协同优化,用智能探索文化保护新路
双向词典项目依托飞桨深度学习技术,高效实现了濒危语言词典的自动化生成,极大减轻了语保工作者的负担。而其背后是英特尔所提供的英特尔® 至强® 可扩展平台具备的强劲算力和多种优化措施,为飞桨平台高效支撑项目运作提供了基础能力和量化加速。
业界尽知,人工智能应用不仅需要高算力作为支撑,而且源于大多数深度学习模型使用32位浮点精度(FP32)构建,复杂度高,模型参数量大,限制了其在一些场景和设备进行部署,需要实施软硬结合优化,才能突破性能瓶颈,高效承载诸如上文双向词典生成等多类应用。
针对上述问题,英特尔携手百度飞桨,基于第三代英特尔® 至强® 可扩展处理器、英特尔® oneAPI工具套件等软硬件组合,在为飞桨平台提供充裕算力的同时,也对整个深度学习流程实施全方位优化,帮助加速各类应用开发和量化部署。
第三代英特尔® 至强® 可扩展处理器依托出色的微架构,发挥多核心、多线程和大容量高速缓存等特性,很好地满足了飞桨平台对通用算力的苛刻需求,同时加持以其内置的英特尔® AVX-512提供的增强矢量处理能力,提升AI 推理和训练效率,为图像分类、自然语言处理、语音识别、语音翻译等广泛的应用开发和部署提供稳健基石。而最新一代的第四代英特尔® 至强® 可扩展处理器更内置一系列加速器,包括全新的AI加速器——英特尔®高级矩阵扩展(英特尔®AMX),覆盖包括训练和微调在内的更多深度学习使用场景,可以为不断变化且要求日益增高的应用提供更为可观的计算性能。
为满足模型快速“瘦身”之需,百度飞桨打造了PaddleSlim深度学习模型压缩工具库,以及为用户提供灵活的压缩策略,而英特尔® 至强® 可扩展处理器内置的AI加速技术--英特尔® 深度学习加速(英特尔® DL Boost),可通过矢量神经网络指令(VNNI)充分提高计算资源和缓存的利用率,减少潜在的带宽瓶颈,为INT8等低精度计算提供优化支持,显著加速AI 推理。由此,帮助飞桨PaddleSlim所支持的量化训练和静态离线量化方法,更好地适用于计算机视觉(CV)和自然语言处理 (NLP)等模型优化过程,这无疑也为双向词典AI方案的开发提供了便利,同时提高了项目运作效率。
同时为激活 VNNI 加速功能,百度飞桨深度学习平台在量化方案实施中还广泛使用英特尔® oneAPI 工具套件,如英特尔® oneAPI 深度神经网络库 (Intel® oneAPI Deep Neural Network Library,英特尔® oneDNN)。借助其统一、简化的编程模型,飞桨用户得以在CPU、GPU和FPGA等不同的架构上方便地调用通用接口来使用平台内置的AI加速技术,而无需担心平台兼容问题。
得益于英特尔® 至强® 可扩展平台与多项优化工具的支持,百度飞桨深度学习平台实现了深度优化,并不断丰富模型资源及应用开发套件,为用户提供了优异的模型及硬件加速体验。而双向词典项目在推动少数民族语言保护领域展现的神奇魔力,就是其典型案例。
“十四五”规划把“强化重要文化和自然遗产、非物质文化遗产系统性保护、推动中华优秀传统文化创造性转化、创新性发展”,作为提高社会文明程度的重要举措;今年的工作报告也强调了“传承中华优秀传统文化,满足人民日益增长的精神文化需求”,对铸就文化新辉煌的重要作用。
英特尔携手百度飞桨践行“科技向善”,优化开源平台,促进濒危语言保护,不仅延续和发扬了语言背后蕴含的文化、知识遗产及其价值,更探索出智能技术赋能的新路;也是英特尔继用人工智能助力长城修缮,通过计算、存储、网络全栈优化解决方案帮助云冈石窟文物保护等,持续展现创新技术对挖掘与传承璀璨历史文化、实现创新创造的新动能的又一成功实践,有助于在让历史智慧照进未来,让宝贵文化遗产丰富人们精神世界的同时,进一步加速人工智能的拓展应用,助力拥抱数字化浪潮,创造更美好的生活。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
2025年10月25日,2025世界青年科学家峰会之人工智能(AI)融合创新发展论坛在浙江温州成功举办。本次论坛由国际院士科创中心主办,中国投资协会能源投资专业委员会、温港院士科创中心承办,中国电工技术学会、中科先进技术温州研究院与温州市电力工程学会提供支持,以“瓯江论道-AI赋能绿色发展”为主题,
个人创业需要启动成本低、无需庞大团队、可快速验证、能利用个人技能或资源。这里分享适合个人创业的十个机会一.AI内容优化与本地化服务·做什么:帮助企业或个人利用AI工具(如GPT-4,Midjourney)优化内容生产流程。例如,为跨境电商撰写多语言产品描述,为小红书博主生成爆款文案,为小公司制作营销
百度AI团队今日正式推出PaddleOCR3.1版本,以突破性的多语言组合识别(MultilingualCompositionPerception,MCP)技术为核心,彻底重构复杂文档处理边界。此次升级标志着OCR领域首次实现对同一文档内任意混合语言文本的精准识别,为全球化企业、跨境业务及多元文化场
导航网站的崛起:从信息过载到精准触达随着全球AI工具数量爆发式增长(2025年已超数万款),用户面临前所未有的选择困境。传统搜索引擎的“关键词-链接”模式难以应对工具筛选的场景需求,垂直化、场景化的AI导航网站应运而生。这类平台通过聚合、评测、分类与推荐四重机制,将分散的工具资源整合为结构化入口。例
当微信公众号文章中出现一个人的名字,它会自动变成蓝色链接,点击即可查看AI生成的“个人简历”——这一微信新功能让不少用户感到被“扒光”在互联网上。近日,微信新上线的“AI搜索”功能陷入隐私泄露争议漩涡。多位网友在社交平台反映,当微信公众号推文中出现本人姓名时,名字会自动变为蓝色超链接,点击即可浏览由
“你自己还搞技术啊?”这句话,我最近用AI做网站的时候,被好几个人说过。言下之意:你是老板,不该干这个。这半年,我一直在用AI做网站,很多人在我评论里、群里、视频都说过,大意是你不开公司,天天琢磨用AI做网站干嘛?网站都是夕阳行业了。本来还没当回事,结果评论区说的人多了,我自己都恍惚了?我做网站20
昇腾,打响了一场Agent前夜的“硬软合围战”
5月13日,阿里巴巴集团发布2026财年Q4及全年财报。财报表示,阿里全栈AI技术投入已正式跨越初期培育阶段,进入正向的规模商业化回报周期。在财年第四季度,阿里AI在模型、云基础设施和应用各层实现加速突破。在AItoB方向,阿里旗下企业级Agent平台“悟空”已于近期逐步规模化放量。悟空是阿里巴巴旗
近日,负债28万元的张先生被短视频广告吸引,支付39.9元咨询费后,对方承诺减免5万元利息,却在收取14350元服务费后失联。新浪黑猫投诉平台显示,涉及“律所”与“债务协商”的投诉已超1500件。面对债务压力,许多持卡人急需知晓平安信用卡逾期怎么处理,却不慎跌入黑灰产陷阱。虚假承诺借律所外壳行骗,黑
“养龙虾”到底要花多少钱?这个问题可能是大家最关心的。我们把成本拆成三部分:服务器租用费+大模型API调用费+杂项开销。第一部分:服务器租用费。最省钱的方案当然是本地旧电脑自托管——零新增成本,电费忽略不计。但如前所述,你需要接受“不是7×24小时在线”的局限性。如果选择云服务器,成本差异就很大了。
不少朋友第一次接触OpenClaw时,都会有一个相同的困惑:这玩意儿到底该装在哪里?OpenClaw(社区戏称“养龙虾”,因Logo为龙虾钳)不是普通的聊天机器人,而是一款本地优先、可自主执行、支持多Agent分工协作的AI执行网关。说白了,它让大模型从“只会说话”变成“会动手做事”——帮你管理文件
01别相信“一键养虾,躺平赚钱”的鬼话打开社交媒体,你可能会看到这样的标题:“养只龙虾自动炒股,零代码养出数字巴菲特!”信了,你就输了。真实情况是:一个做跨境电商的小哥花了200元租服务器、订阅API,指望龙虾帮他炒股暴富。结果龙虾开始几天还像模像样,后来直接摆烂,生成个干瘪的大纲就敷衍了事。AI是
一张证书引发的讨论4月7日,北京嫣然天使儿童医院给陈光标发了一张感谢证书,感谢他捐赠1000万元。这事说起来挺曲折的。此前陈光标高调说要赠给张雪一台价值1300万元的劳斯莱斯,张雪回应“收了,八折卖掉捐给嫣然”,一番拉扯之后,陈光标把车变现,1000万元直接打到了嫣然医院账上。医院发证书感谢,本来是
2026年4月7日,国家安全部就AI核心术语“词元”(Token)发布安全警示,强调在日均调用量突破140万亿规模的市场背景下,需高度警惕由此引发的数据泄露与金融诈骗风险。据统计,截至今年3月,我国日均词元调用量已超过140万亿,较2024年初增长1000多倍。词元作为大模型处理信息的最小单元,兼具
如今出门,如果你还没用过AI智能助手,可能真有点跟不上节奏了。无论是写作文、查资料,还是规划出行路线,越来越多的人已经习惯随手打开AI问一句。这股热潮背后,中国AI大模型用实打实的数据交出了一份亮眼的成绩单。根据全球知名AI模型聚合平台OpenRouter的最新数据,在3月30日至4月5日这一周,中