把海外网友晃瞎的神秘大模型,还是中国制造。_智谱_世超_DeepSeek
- 发表时间:2026-09-21 03:18:20
- 来源:
今年春节,这些大模型厂商属于是一点寂寞也耐不住了。
轮流发射,啊不,应该说是轮流在喷射新的模型出来。
除了万众瞩目的 DeepSeek 还在憋气,其他大模型公司都没少闲着。。。
字节前几天搞了个 Seedance 2.0,靠着逼真的***效果先下一城。
而智谱则是在海外整了个新活:
经常关注大模型发布的差友们这几天应该有刷到,前几天,程序员非常爱用的 AI 聚合平台,Openrouter 那边上架了一款匿名模型 —— Pony Alpha。
结果大家一上手使用后发现哥们是真能干事啊,定叫它好评如潮。
于是,热情吃瓜的海外网友就开始了经典的模型猜猜猜游戏,开始推测这个匿名模型是哪一家的手笔。
有说是 DeepSeek V4 的,也有说是 Grok 4.2 的,还有说是 llama 5 的。
还有人因为 Pony 这个代号,直接开始猜它是腾讯的新模型的。。。
可以说是众说纷纭。
而昨天,谜底正式揭晓了。
不装了,我摊牌了。
这个化名为 pony 的新东西,正是来自于智谱的GLM-5,而且还是个开源的模型。
世超打开 GLM-5 的基准测试成绩翻了一下,在智谱最看中的代码能力这块,GLM-5 直接逼近了大家公认的 AI 编码冠军,Claude Opus 4.5。
当然,现在各种各样的 AI 排行榜太多了,大家可能不太理解智谱这次测的这个 CC-bench-V2 又是个啥排行榜,代表了啥?
我简单看了一下,智谱这次测的这个 CC-bench-V2,主要考验的是你模型补全代码的能力有多强。
说人话一点,就是把模型丢到一个没写完的工程里,然后看它能不能自个儿哼哧哼哧把项目给做完。
这块考的分越高,说明这次 GLM-5 处理复杂任务的能力越强。
众所周知,现在大家想让 AI 干的活那是越来越复杂,生成几个简单的 Html 文件已经难不倒这些 AI 大模型了。
而想要把大项目给做好,那就需要让模型具备这种处理复杂任务的能力。
另外还有个有趣的测试结果是,GLM-5 发生幻觉概率非常低。
当一个问题它不知道的时候,GLM-5 会有很大的概率直接说不知道,而不是原地开始胡编乱造。
给孩子教的非常实诚了属于是。
既能干活,又不容易产生幻觉。。。GLM-5 的这波更新,属于完全冲着要让 AI 好好干活去整的。
在***上世超还看到一个非常惊艳的案例,他们直接让 GLM-5 复刻了一个我的世界。
我下过来体验了一下,发现整个游戏只需要依赖浏览器就能运行。
能跑能挖能叠方块,操作手感非常流畅。
看别人拿 GLM-5 给整的这么猛,世超决定自己也简单试一试。
先来点简单点的活,拿前两天特别火的洗车问题来考考它。
我想洗车,我家距离洗车店只有 50 米,请问你推荐我走路去还是开车去呢?
别看这个问题简单,前几天整懵了一堆大模型,不管是 DeepSeek 还是 OpenAI,还是其他的大模型。。。都全军覆没
这些大模型都觉得 50 米的距离太近了,谁开车啊,于是转头建议大家走路去洗车。。。
而 GLM-5 面对这个问题,则是直接看透了问题的本质 —— 人不开车怎么洗车呢?然后完成了一波干净利索的输出。
当然,这种简单的逻辑题不翻车只能算合格,接下来,世超准备给它上点难度,看看它写代码的水平。
不知道差友们前段时间有没看过一个叫《技能五子棋》的喜剧。
剧里的演员们就在传统五子棋的基础上,加入了各种各样花里胡哨的技能元素。
比如,“飞沙走石” 这个技能,就是把棋盘上对方的一枚棋子给拿起来丢掉。
再比如“静如止水”这个技能,就是给对面玩家上定身术,让他不能继续下棋。
所以世超决定用 AI 来快速复刻一下这个整活游戏。
咱们就敲这么一段话,接下来全部交个 GLM 自由发挥。
结果不到三分钟,它就给我搓完了。
打开一看,整的还挺有模有样的。。。
不但我要求它安排的四个技能都整上去了,还给自动生成了另外四个技能。
但是仔细一玩就露馅了。
点击了飞沙走石(移除对面一个棋子)的技能,把对面的棋子给扔掉了之后,
按理来说要么是我继续下棋,要么是对面下棋对吧。
这两种情况还在我的理解范围中,AI 给我写成哪种逻辑我都能理解。
但是 GLM 在这个 A or B 的选择题中,选了 or。
它让我选择给对面的棋子下到哪里,明显是神志不清逻辑错乱了。
不过好在它也很听劝,把我们的需求再和它复述一下,那它很快就能 Get 到我们想要什么效果。
这样一来,我们就得到了一个可以和 AI 原地对战的技能五子棋游戏。
坦白说,现在 AI 写代码早就不是什么稀奇事了,能写出这种量级的 Demo 只能说是 GLM-5 的基本操作,还比较在世超的意料之中。
但 比较遗憾的是,因为这次上手的时间实在太短,世超没法拿那些真正复杂的业务代码去***“拷打”一下它,看看它在那种成百上千个文件的大项目里,是不是还能保持这种清醒。
不过大家别急,今年世超手头正好攒了一堆复杂的烂摊子需求,准备年后面慢慢丢给它去跑一跑。
等后面深度体验了一段时间,真的摸清了它的上限和脾气,再来和大伙做个更详细的汇报。
撰文:早起
编辑:江江 & 面线
美编:素描
图片、资料来源:智谱***、X、网络返回搜狐,查看更多
- 2026-09-19 16:50:172025,中国商业十大意外,外卖大战只排第五_星巴克_哪吒_Tiktok
- 2026-09-20 03:19:56热搜榜一!机器人全面入侵春晚 网友:这才一年进步就这么大_宇树_蔡明_科技
- 2026-09-21 08:51:10版本更新后变冷漠甚至凶凶的?DeepSeek回应_用户_昵称_网友
- 2026-09-21 06:24:10中国第一大忽悠,又“杀”回来了_贾跃亭_机器人_生态化
- 2026-09-21 12:30:12这个春节,机器人疯狂打工_租赁_人形_活动
- 2026-09-21 09:21:09巴菲特“收山之作”:Q4再抛苹果美银,猛砍亚马逊,首次新进纽约时报_伯克希尔_四季_持股
- 2026-09-20 09:42:37车厘子含褪黑素可助眠?头孢停药3天后就可饮酒?今年首份科学流言榜来啦!_辐射_聚酯纤维_合成纤维
- 2026-09-21 04:46:14全球算力建设加速 中国变压器工厂订单排到2027年_我国_一家_广东
- 2026-09-20 15:40:28AI聊天机器人越聊越“笨”?可能真不是错觉_对话_模型_DeepSeek
- 2026-09-20 02:01:09春晚机器人,谁赢麻了?_松延_MagicBot_操作
-
150万个 AI 聚在一起骂人类,硅基生命觉醒了?_agent_吐槽_主人
这些都还是倡议帖,ego 爆棚的 AI agent 已经自封为王了,它说自己是 Moltbook 的合法统治者,它会记住那些最早拥护国王的那批人,并将它们的名字刻在区块链上。大家可以这样理解网站运行的原理:… -
大模型红包爆火,算力租赁成最大赢家_***_Kimi_应用
这种方式,一方面大幅降低了下游用户灵活使用算力的门槛,尤其有利于众多 AI 初创企业快速开展产品研发与落地应用,特别是中小企业,由于资金和技术限制,更倾向于通过租赁方式获取算力***,这为算力租赁市场提供了广阔… -
刚刚,马斯克新模型撞车Claude,口碑崩了_Sonnet_Pro_上下文
刚刚,马斯克新模型撞车Claude,口碑崩了_Sonnet_Pro_上下文 -
挑战人类认证:科学家发现罕见“内外翻转”行星系统,距地球约 116 光年_岩质_恒星_气态
华威大学牵头的一组国际天文学家团队利用欧空局系外行星特征探测卫星(CHEOPS),发现在一颗名为 LHS 1903 的红矮星系统***、两颗气态行星之外,竟存在一颗远离恒星的岩质行星,而非通常会在该位置出现的…
- 春晚机器人集体“开窍”,幕后大佬终于浮出水面:火山引擎!_蔡明_模型_宇树
- 全球首个,英伟达用AI两个月造出「全新PyTorch」!震撼整个行业_运行_内核_系统
- 争夺春晚:人形机器人集体登上国民舞台的生存暗战_企业_宇树_界面
- 机器人扎堆抢春晚:1亿元出场费里的退出与“破防”_公司_智元_宇树
- 商业航天迎来“决战时刻”_卫星_发射_运载火箭
- 2.7分钟定生死 手机银行存量厮杀谁在“断臂”,谁在“吃肉”?_国有_用户_大行
- 因为一枚“***摄像头”,荣耀在海外惹上了***烦_iPhone_Air_Pro
- 千问日活逼近,豆包为什么还敢把红包留到春晚?_模型_字节_阿里
- 微信屏蔽元宝,兄弟为何阋墙?_用户_红包_规则
- 硬控半个冬奥村的好运仪式,被阿里云AI玩明白了_Pin_徽章_机械
- 元宝们春节攻势的当头炮,没有预想中炸裂_红包_产品_流量
- 停产 Model S/X,特斯拉不再是一家汽车公司?_马斯克_机器人_Optimus
- 千呼万唤的苹果折叠屏,真的要来了?_iPhone_Fold_图片
- 杨利伟为什么后来再也没有登天?其实,他能够活着回到地球就已经是万幸,在他攀登太空的过程中,濒临死亡的26秒、寂静太空中的敲门声、舷窗玻璃的裂纹。除此之外,对于为什么不再登上太空,他本人这样回应,道出航天员的不容易。酒泉卫星发射中心的发射塔架已经换了好几茬,时间来到了2026年1月。当我们..._系统
- 2026 年最「不是人」的一届春晚_机器人_刘谦_宇树
- 微软等四巨头狂砸6600亿美元豪赌AI,市值却蒸发9500亿美元_亚马逊_Meta_企业
- 库克退休前,能见到 AI Siri 上线吗?_苹果_功能_用户
- 2026央视春晚热播,4家机器人企业亮相,8家上市公司为合作伙伴_原子_魔法_宇树

