1. 创业头条
  2. 前沿领域
  3. 人工智能
  4. 正文

当开源进入AI时代 百度打出一套组合拳

 2020-09-29 09:43  来源:A5专栏  我来投稿 撤稿纠错

  【推荐】海外独服/站群服务器/高防

1997年,著名黑客埃里克·斯蒂芬·雷蒙在《大教堂与市集》一书中预测了两种不同的自由软件开发模式:

一种是大教堂模式,原始代码是公开的,但每个版本的开发过程由一个专属的团队管控;一种是市集模式,原始代码同样是公开的,不过是放在互联网上供人检视及开发,最直接的例子就是Linux。

最终“市集模式”证明了开源比闭源更加高效,全球99%的组织在IT系统中使用了大量的开源代码,开源的价值也被越来越多的企业重视。比如微软在2018年以75亿美元的代价将代码托管平台 GitHub 收入囊中,IBM则在2019年斥资340亿美元收购了著名开源解决方案供应商红帽。

即便是开源文化一度贫瘠的中国市场,近几年围绕开源项目的讨论也逐渐热闹了起来,BAT代表的科技巨头们扛起了国内开源的大旗,陆续加入到开源项目的建立和维护中,一次次释放了涌动的激情。

对于中国的开源文化从哪里来,又将要走向何处,百度这样的开源力量可以说是不可错失的研究样本。

01 聚焦AI的技术派

早在上世纪90年代末,开源力量就在太平洋的彼岸澎湃。但彼时的中国几乎绝缘于互联网之外,就连计算机都还是少数派的玩物。

时间上的迟到削弱了中国在开源世界中的存在感,缺少在硬件和底层技术上的话语权,缺少自主的操作系统和软件生态,缺少通过开源实现商业化的成功案例,导致中国开发者在很长一段时间内扮演着学习者的角色。

人工智能浪潮的兴起,为中国开发者创造了追平前辈们的机会,何况人工智能和开源几乎有着天然的关联。

正如人工智能领域家喻户晓的一个比喻:如果说AI是一场饕餮盛宴,数据是原材料,算力是天然气,算法是菜谱,开源就如同无数厨师用经验与智慧合著而成的烹饪百科全书。其他厨师可以从书中学习经验制作菜肴,也可以指出书中存在的问题,并源源不断地为百科全书贡献新的菜谱。

百度则进一步证明了这样一个道理:开源不是论资排辈的武林江湖,而是属于技术派的自由世界。

2013年百度率先开源了可视化库ECharts,提供了直观、生动、可交互、可个性化定制的数据可视化图表,并由此开始了百度的开源之路。

2016年是百度开源的破局之年,深度学习框架百度飞桨正式开源,填补了国产深度学习框架的市场空白。

2017年百度开源继续凶猛发力,当年发布了全球首个自动驾驶开源项目——Apollo 自动驾驶开放平台,加速了智能驾驶的行业进程。

2018年百度内部应用了十年的 Doris正式拥抱开源世界,孵化于百度凤巢的交互式 SQL数据仓库,至今仍是国内唯一的分析型数据库。

2019年百度开源项目持续刷新,扛住了数次春晚红包流量波峰的七层流量转发平台BFE对外开源,并在2020年6月份被 CNCF接纳为Sandbox Project。

截止到目前,百度已经主导了上千个开源项目,在GitHub上收获了超过30万Star,社区贡献者数量也已上万。不过作为AI领域的技术派,百度的存在感俨然不只是建立在开源项目的数量上,同时还刷新了中国开源项目的高度。

注:2020/2019年度全球开源深度学习框架活跃度排名榜单

按照衡量深度学习框架活跃趋势的权威性指标pull request的数据显示,百度飞桨PaddlePaddle均力压谷歌TensorFlow,紧随Facebook PyTorch之后,已经成为了国内第一、世界第二的深度学习开源框架;Apache ECharts (incubating) 在 Github 中的 star 数已经超过 41.4k,每周 npm 下载量超过 22 万;Doris被广泛应用于美团、小米、京东、华为、快手等头部企业的项目中……

开源创造了技术最大的公约数,百度正成为这个时代的弄潮人。

02 社区中的建筑师

开源的世界里流传着这样一句格言:社区重于代码。

这句话的题中之意,恰恰道出了开源世界的铁律,开源社区的聚合和放大效应比开源代码更有价值。

正如开源社联合创始人刘天栋给出的观点:“开源市场就像魔方,表面上看每个成员都是独立的一面,但经过排列、融合,会呈现出很多种组合可能。”这也是不少人为开源唱赞歌,并努力推动中国开源进程的直接原因。

开源的精神是自由的,可细究到开源世界里的话语权,起决定性作用的往往不是精神,而是精神背后的市场规律,以至于常常出现开源社区被强权左右的现象。就连一向以“开源”自居的GitHub,也屡屡传出封禁伊朗、俄罗斯等国籍开发者的消息,已然违背了开源社区存在的初衷。

注:全球范围内开源社区百花齐放

留给BAT们的挑战在于,所要扮演的角色不只是“两耳不闻身外事”的技术派,还要着实捍卫中国开发者的权益。

在开源社区的运作中,百度找到了两个着力点:

一是深度参与了国内外顶级开源基金会和组织,成为了 Apache 基金会、Linux 基金会以及云原生计算基金会的金牌会员,以及开放原子基金会的理事单位。由于基金会拥有对开源软件的管理和所有权,积极参与到基金会的运作有利于维护社区的中立,比如避免中国的开源项目被恶意孤立。

二是战略投资中文开源技术社区开源中国,后者运营的Gitee代码托管平台已经是全球仅次于GitHub的代码托管平台,每日约增加5000名开发者、200家企业客户、1.7万代码仓库,已经具备了在国际市场上与GitHub全面抗衡的基础,也是中国开源力量不可或缺的底牌所在。

注:Gitee代码托管平台

打一个比方的话,百度对开源的认识并没有局限于贡献了多少代码,还在一砖一瓦砌出中国的开源社区生态。

至于其中的原因,可以参考百度创始人李彦宏的观点:“开源并不意味着所有东西都是免费的,还需要是我们自主可控的,很多开源的东西还是掌握在别人手里的,这个我们要有充分的认识。”

无独有偶,华为消费者BG软件部总裁王成录也有着同样的担忧:“大家想一想,我们现在的软件开发,开源已经是大家都无法再去把它忘掉的模式,那么这些开源社区的代码就是离不开的资源。如果中国没有自己的开源社区去维护管理这些代码,我们中国的所有软件行业将是非常危险的。”

社区是开源协作精神与创新的摇篮,除了对技术的一腔豪情,还要勇于担当起秩序守卫者的责任,毕竟现实世界不同于理想主义。

03 产业化的布道者

跳出开源中立与否的语境,中国开源的现实问题在于产业化。

整个商业的重心已经从To C转向To B,新基建、智能经济的浪潮再度为这种趋势摁下了“快进键”,开源平台能否抓住产业智能化的窗口期,释放出技术拓荒的生态红利,将是打通战略价值的关键一跃。

国内开源生态存在的短板也不无明显,比如开源软件集中在数据库、操作系统等应用层,缺少深入产业细枝末节的生态协同,开源技术的落地应用还有很长一段路要走。也就是说,中国的开源生态还集中在产业链上游,中游和下游的环节仍然有些薄弱,需要花费一定的时间补课。

不过这并非是唱衰中国开源生态的借口。

一方面,中国有着全球最庞大的人口和市场,将是最好的开源项目孵化器。

特别是在新基建浪潮的驱动下,将有越来越多的企业拥抱开源项目。百度、华为等行业领头羊们也开始将开源软件从技术与商业上形成合围,提供各个层次的技术赋能,比如在飞桨和百度大脑的基础上,通过与百度智能云的融合打通,向外界输出智能交通、智能家居、智慧金融等场景化的解决方案。

注:百度智能云服务架构

另一方面,源代码并不是开源最重要的元素,而是人与人通过代码的联结。

百度代表的科技巨头纷纷刮起了产学结合风,激励国内的大学生们参与到开源社区的建设中来,增强和激励开源精神的同时,也在为行业持续输送高端人才。可以找到的例子有很多,Gitee上的高校数量已经超过1000所、百度飞桨推出了针对高校的生态激励计划……开源的产业化进程正在以肉眼可见的速度推进。

这个过程中,百度开源迎来了自己的第三个角色,即产业化过程中的布道者。

小凯(化名)是一名本科在校生,却在飞桨社区中被称为“GT大佬”。除了有一副为别人答疑的热心肠,小凯还参与了大自然保护协会的野生动物图片筛选和标注项目,找来自己比赛时的小伙伴,利用飞桨的监督学习算法完成了大批量数据标注的验证和调优,预计将在年底将项目交付大自然保护协会。

小鹏(化名)是飞桨社群中的一员,在社区里认识了很多有趣的朋友,并且尝试借助飞桨搭建自己的深度学习模型。小鹏的想法是通过摄像头捕捉和识别手语,再将手语转化成语音,从而实现和聋哑人交流的目标。目前小鹏的模式已经有了比较准确的识别,并将项目代码上传到了社区开源,希望可以帮助更多的人。

小凯和小鹏都是百度开源社区中的一份子,或许他们的力量还有些稚弱,对社区的贡献还非常有限。可当00后的年轻一代都开始活跃于开源社区的时候,中国的开源生态已经燃起了持续壮大的星星之火。

04 写在最后

中国开源的崛起和扩张,似乎并没有什么捷径可走。

需要更多聚焦AI的技术派,持续贡献优质的开源项目,让中国在开源世界的站位逐步从边缘移向舞台中央;

需要更多社区中的建筑师,不断增强中国在开源社区中的话语权,并一步一个脚印的打造中国的开源社区;

还需要更多立足于产业化的布道者,将开源项目和产业需求深度融合,同时培养下一代年轻人的开源信仰。

至少在这条看得见的路上,百度们正在坚定向前。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

相关文章

  • 开发者怎么拥抱智能化浪潮?昇腾AI给出了“通关指南”

    在大模型代表的新一轮技术浪潮下,智能化转型已然是毋庸置疑的趋势,科技大厂们纷纷给出了智能化的“道法术”,大大小小的企业也开始更新认知,想要从创新中挖掘出驱动增长的新质生产力。但现实和智能化的美好愿景之间,仍然横亘着一片鲜有人涉足的“荒海”,脚下还没有坚实的路。3月23日在天津举办的昇腾AI开发者创享

    标签:
    ai技术
    ai智能
  • 8款AI视频生成产品实测,谁将成为中国Sora?

    ©自象限原创作者丨罗辑、苏奕编辑丨程心2024年开年,科技圈没有什么比Sora的出现更让人兴奋。如同ChatGPT在2023年初带来的LLM创业潮,Sora的发布也同样将视频生成模型推到了风口浪尖。科技巨头猛推产品,创业公司则乘风而上。3月13日,AI视频大模型公司爱诗科技完成亿元级人民币A1轮融资

    标签:
    ai技术
    ai智能
  • AI业务收入盈利双增,但百融云没有止步

    当为科学技术巡游一方的神,行至人工智能的篇章,中国公司的2023年报里,写着AIGC的前世今生。翻开科技进步的编年史,每一次技术革命都有这样一条铁律:技术革命的最大受益者,通常不是率先做出突破的开疆派,而是率先将其发扬光大的技术流。靠着工业革命超越日不落的美利坚,把同样的故事,转载到了50年代的半导

  • AI手机需要新故事

    言必称AI的时代,已经来了,尤其是随着sora等的震撼发布,以及Google、微软和国内大厂等在AI研发、大模型等方面的日新月异。就手机行业而言,在存量时代出货量连年不及预期的情况下,如何刺激用户换机,成了一道摆在所有手机厂商面前的共同命题。从三星到国内的一些手机厂商,实际上已先行一步打出了“AI手

    标签:
    ai技术
  • 智能校对大模型文修2.0重磅发布:赋能“人工智能+办公”转型升级

    3月22日,由天津蜜度文修智能科技有限公司主办的智能校对大模型文修2.0智臻发布会在津举行。发布会以“大模型赋能‘人工智能+办公’体验升级”为主题,邀请语言智能领域专家,以及各大媒体机构和合作伙伴,围绕大模型技术、应用落地发展、标准化进程进行分享交流。发布会上还发布了智能校对大模型文修2.0。天津市

  • 阿里通义千问重磅升级:免费开放1000万字长文档处理功能

    3月22日消息,阿里通义千问重磅升级,向所有人免费开放1000万字的长文档处理功能,成为全球文档处理容量第一的AI应用。即日起,所有金融、法律、科研、医疗、教育等领域的专业人士,都可通过通义千问网站和APP快速读研报、分析财报、读科研论文、研判案情、读医疗报告、解读法律条文、分析考试成绩、总结深度文

    标签:
    通义千问

编辑推荐