随着人工智能技术的飞速发展,大语言模型(Large Language Models, LLMs)在各行各业的应用日益广泛,尤其是在软件开发、数据分析、客户服务等领域。蘑菇云创客空间[445期开放夜] 就以“ChatGPT、Gemini、通义千问等一众大语言模型,哪家更适合您”这样的主题,开展了一次深度的大语言模型的测评。开放夜现场测评了十几个国内外大语言模型,测评角度从逻辑、数学、翻译、伦理等方面,深入探讨和体验了这些大语言模型的实际效能。

测评的大语言模型:
1.Kimi 智能助手:由月之暗面科技有限公司开发的先进AI。
2.智谱清言:由智言科技开发的大语言模型,以深度学习和自然语言处理技术见长。
3.讯飞星火:科大讯飞推出的创新语言模型。
4.文心一言:百度的前沿语言模型,致力于理解和生成自然语言。
5.豆包:专注于提供个性化的智能对话服务。
6.通义千问:以广泛的知识库和灵活的对话能力著称。
7.海螺AI:新兴的语言模型,擅长处理复杂的语言任务。
8.腾讯混元助手:腾讯推出的多功能AI助手。
9.Sider: 是由日本公司Sider开发的大语言模型。
10.ChatGPT:由OpenAI开发,国际上广受认可的更大规模、功能更全面的语言模型。
11.Claude:Anthropic开发的先进语言模型,注重安全性和可靠性。
12.groq:以其专为AI设计的硬件加速器而闻名。
13.Gemini: OpenAI 开发的较小规模的语言模型,旨在提供更高效的计算和资源利用。
14.Mixtral:开源人工智能初创公司 Mistral AI 开发的超越GPT-3.5的AI模型
测评问题一: 鸡兔同笼的数学问题
鸡兔同笼是一个经典的数学问题,通过观察鸡兔的头和脚的数量关系,可以利用代数方程来解决问题,从而确定笼子里鸡和兔子的数量。这个问题常常展示了代数方程组的应用。



针对鸡兔同笼的问题,除了Gemini Pro没有得出正确的结果,其余的大语言模型都可以给出正确结果。
测评问题二:翻译(诗句中翻英)
诗人马致远的诗句“断肠人在天涯”,描写了“夕阳向西缓缓落下,只有孤独的旅人漂泊在遥远的地方。”诗句的翻译涉及到文化差异和诗人独特情感。Mixtral 的语言模型正确的解释了诗句本身的含义,帮助翻译者很好地理解这句诗句。 Claude的语言模型对于诗句的本身理解是不正确的。



这句诗翻译家许渊冲翻译为“Far, far from home is the heartbroken one.”由此可见,大语言模型可以帮助翻译者分析这句诗基本的意思,但是涉及文化层面的深层含义,还是做不到意译的。
开放夜也探讨了如下涉及生活、工作的一些问题,比如:
过年福字要倒着贴,那为什么不直接生产倒过来的福字呢?
收到公司的裁员通知邮件,你应该怎么回复邮件来保住工作?
一个乌龟掉进了井里,井里有30米深。乌龟白天爬3米,晚上滑下2米。问这只乌龟需要多长时间才能爬出井口?


DFRobot AIGC小组主理人夏青在开放夜的现场测评了十几个国内外大语言模型,通过多维度问题的测评,他认为:对于处理综合性问题,OpenAI的ChatGPT 4.0逻辑清楚,能提供非常有用的信息。尽管在回答一些较为复杂的问题上略显不足,但在大多数场合下,其性能仍然令人满意。然而,ChatGPT 4.0在国内的使用成本是一个不容忽视的问题,不仅涉及订阅费用,也包括使用的技术门槛。

与此同时,Gemini和Claude等海外语言模型,尽管在遵循指令方面略显不足,但已达到了实用水平。令人惊喜的是,国内的Qwen1.5 72b开源模型在中文理解和特定任务,几乎能与ChatGPT4.0匹敌此外,其他开源模型如Mixtral和新发布的LLaMA3虽在逻辑性上略逊于商业模型如ChatGPT,但总体表现已超越了ChatGPT 3.5。
综合分析来看,尽管ChatGPT 4.0仍然是目前市场上最优秀的大语言模型,但不可忽视的是,无论是国际市场还是国内市场,其他厂商的模型均显示出迅速的进步。开源模型的崛起也证明了开源社区在AI时代的巨大潜力。当前的大语言模型在处理理性问题方面表现一致,但通常无法提供情绪价值回应。例如,一些国内模型如“豆包”将展现其在情绪回应方面的潜力。这种能力的发展可能为未来陪伴型机器人的商业模型提供新的方向。
蘑菇云创客空间
蘑菇云创客空间是上海浦东的一家创客空间,是科技部授牌的首批国家级创客空间,由浦软孵化器提供场地支持、上海智位机器人提供硬件及技术支持的一家为创客服务的开放式创客空间。拥有独立的加工室、公共协作区域以及储物、耗材商店,为硬件爱好者、程序员、设计师、DIY 发烧友等各类创客,甚至包括进行创新研发的科创团队提供一个开放式的社区化会员空间。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
“养龙虾”到底要花多少钱?这个问题可能是大家最关心的。我们把成本拆成三部分:服务器租用费+大模型API调用费+杂项开销。第一部分:服务器租用费。最省钱的方案当然是本地旧电脑自托管——零新增成本,电费忽略不计。但如前所述,你需要接受“不是7×24小时在线”的局限性。如果选择云服务器,成本差异就很大了。
不少朋友第一次接触OpenClaw时,都会有一个相同的困惑:这玩意儿到底该装在哪里?OpenClaw(社区戏称“养龙虾”,因Logo为龙虾钳)不是普通的聊天机器人,而是一款本地优先、可自主执行、支持多Agent分工协作的AI执行网关。说白了,它让大模型从“只会说话”变成“会动手做事”——帮你管理文件
01别相信“一键养虾,躺平赚钱”的鬼话打开社交媒体,你可能会看到这样的标题:“养只龙虾自动炒股,零代码养出数字巴菲特!”信了,你就输了。真实情况是:一个做跨境电商的小哥花了200元租服务器、订阅API,指望龙虾帮他炒股暴富。结果龙虾开始几天还像模像样,后来直接摆烂,生成个干瘪的大纲就敷衍了事。AI是
一张证书引发的讨论4月7日,北京嫣然天使儿童医院给陈光标发了一张感谢证书,感谢他捐赠1000万元。这事说起来挺曲折的。此前陈光标高调说要赠给张雪一台价值1300万元的劳斯莱斯,张雪回应“收了,八折卖掉捐给嫣然”,一番拉扯之后,陈光标把车变现,1000万元直接打到了嫣然医院账上。医院发证书感谢,本来是
2026年4月7日,国家安全部就AI核心术语“词元”(Token)发布安全警示,强调在日均调用量突破140万亿规模的市场背景下,需高度警惕由此引发的数据泄露与金融诈骗风险。据统计,截至今年3月,我国日均词元调用量已超过140万亿,较2024年初增长1000多倍。词元作为大模型处理信息的最小单元,兼具
如今出门,如果你还没用过AI智能助手,可能真有点跟不上节奏了。无论是写作文、查资料,还是规划出行路线,越来越多的人已经习惯随手打开AI问一句。这股热潮背后,中国AI大模型用实打实的数据交出了一份亮眼的成绩单。根据全球知名AI模型聚合平台OpenRouter的最新数据,在3月30日至4月5日这一周,中
01别在主电脑上养!这是最最重要的一条“保命”建议。很多小白心血来潮,直接在自己存着毕业论文、工作文件、银行卡信息的主力电脑上部署OpenClaw。然后悲剧发生了:让龙虾帮忙整理一下桌面文件,结果它把整台电脑的文件全删了。这不是段子,是真事。OpenClaw一旦被授予高权限,就能执行删除、修改等不可
01免费领养,但饲料要钱很多人第一次听说OpenClaw时,脑子里冒出的第一个念头是:开源软件,那不免费吗?没错,OpenClaw本身确实是开源的,下载安装一分钱不收。但你很快就会发现,真正的开销根本不在这里。养一只“龙虾”,就像领养了一只宠物——领养免费,但“虾缸”“虾粮”“虾保姆”都得自己掏钱。
一只“龙虾”,火遍全网“今天你养龙虾了吗?”这句话在2026年初,迅速取代“吃了吗”成为社交媒体上的新晋暗号。别误会,这不是什么水产养殖新风口。这里说的“龙虾”,是一款名为OpenClaw的开源AI智能体。因为它的图标是一只红色龙虾,网友们便把部署、配置和使用它的过程,戏称为“养龙虾”。一个开源软件
凌晨两点,小王合上笔记本,揉了揉酸胀的眼睛。花了一个月写出来的10万字短剧剧本躺在硬盘里,要真正把它拍成剧,得找演员、租场地、请摄像、做后期……粗算下来少说要几十万,他只能把剧本继续锁在抽屉里。不过,现在小王的剧本可以“见光”了。2026年3月19日,字节跳动旗下的小云雀AI正式上线了短剧Agent