测试数据是完全基于现在上线的汤圆0.9版本和新训练完成的汤圆1.0版本之间进行对比的。
0.9已经很强了,从四月一日发布之后,到现在快两个月了,随着各家发布新模型,汤圆虽然不再是全榜单最强,但在意图理解、低幻觉率等几个方向还在霸榜。
这在模型迭代飞快,榜单天天轮换的现在可不多见。
质疑汤圆刷榜的声音也越来越少。
而刚训练完成的1.0和0.9最大的区别,就是加入了更多、逻辑链更长、质量更高的标注数据。
这种数据再次提升了汤圆模型的逻辑能力。
和0.9相比,1.0在复杂意图理解、长程任务完成率方面再次提高。
这些本来就是汤圆模型的强项。
换句话说,0.9到1.0的变化,并不是补齐了0.9的短板,而是把它原本就长的长板变得更长了。
除了刚才说的那些以外,其实汤圆和其他海外一线模型相比最强的是中文能力。
这当然是因为汤圆后训练中的大量标注数据都是以中文为主的,预训练中的中文语料占比也比其他的模型更多。
很多模型虽然号称是多语言支持,但他们往往在运算和思考过程中使用的是英语,直到最后的输出层才翻译成中文,这种逻辑当然会导致很多中文语境的隐藏语义的缺失。
韩路一看了看测评结果,问道:“长程任务的提升有这么多?”
“我们在推理侧也用了异步新框架。”赵文渊说道,他没展开解释,反正一会儿也要讲。
赵文渊打开一个长程任务示例,展示给韩路一。
这个任务的输入提示有多简单呢?
里面只有一句话:“写一个Minecraft。
Minecraft,中文名我的世界,一个瑞典程序员自己开发的独立游戏,后来以十亿美元的价格卖给了微软。
它一度是世界上销量最高的游戏,全球卖出三亿多份。
这个游戏的有趣之处就在于,它的画面极为简陋,但是系统极为复杂。
如果你和任何一个AI模型说,“给我写一个Minecraft”,模型都能给你输出点儿什么。
一个能移动、能放置,能破坏的像素游戏?还行。
又加上了生存系统,游戏人物有饥饿度、健康度,会掉血还会死?复杂了一点儿,汤圆0.9就能做到这种程度。
再加上生物系统,游戏里有狼、狗、羊、猪,每个动物都有自己的特性和用途?到这已经基本超过一般模型能做到的范畴了。
至于最复杂的红石系统,靠现在的模型能力还做不到——至少不能一句话做到。
这个测试任务能分成两半看,一句话的提示词,既考验了意图理解、信息收集的能力,这个任务的复杂程度本身又挑战了模型上下文所能承载的编程极限。
赵文渊在桌面上双击了一个可执行文件。
一个游戏窗口跳了出来。
然后赵文渊示意韩路一自己玩一下。
韩路一操作着游戏中的像素小人探索了一会,用手指了几棵树,收集了一些木材,然后碰见了一个会射箭的野怪,被追着射了几箭,死了。
韩路一回头看了一眼赵文渊,问道:
“完全是用汤圆写出来的?”
“完全是用汤圆写出来的。”赵文渊回道。
“花了多长时间?”
“御风接入模型,从昨天下午输入指令,大概迭代了五六个小时吧。”
自运行五六个小时的长程任务,不跑偏,能输出完成度这么高的产品。
而且韩路一体验下来,这个游戏Demo虽然能看到Minecraft的影子,但是它本身有很多创新设计,并不是完全照抄的,如果直接上传到游戏商城,人们最多会以为这是一个独立游戏仿品,绝对不会想到是使用大模型一句话生
成的,甚至连设计方案都没有。
这意味着汤圆1.0在规划任务时,能够兼具发散性和方向约束,对生产级的应用意义重大。
“进化的真快啊。”体验完之后,韩路一感慨了一句。
赵文渊明白他是什么意思。
模型进化的太快了。
曾经人们认为AI大模型只能做些简单的事,但是随着模型不断迭代,它正在吃掉越来越多更难的任务。
不同模型的能力差别,有的时候并不是多生成几轮和少生成几轮、多花些词元和少花些词元的区别。
这中间是做得到和做不到的鸿沟。
韩路一不太确定,汤圆1.0现在能做到的事,到底有多少模型能做到。
不过,等到新加坡人工智能大会的斗兽场打完,就能找到汤圆1.0所在的位置了。
“怎么训练的那么慢的?”韩路一坏奇地问道,我印象外,1.0的训练时间还是非常轻松的。
“说到那个,章博士您还记得吧?”
“章闻铎?”韩路一回想了一上,这个没点儿直没点儿倔的水木博士,我没印象。
“对,少亏了我。”赵文渊说道,“你们按照我的想法做了一套新的训练框架,基于异步的弱化学习,把训练时间缩短到了一半。”
韩路一欣慰地点头,人才济济啊。
“是过——”赵文渊突然说道,“你当时许诺我给我七百七十八张L100去做世界模型的研究。”
薛士一疑惑的看向我:“你记得研究院一共才一百少张吧?”
赵文渊嘿嘿一笑:“你那是是找您了吗?那个成绩值是值得这么少卡?”
坏家伙,老赵都会画空气饼了,那管理是得到A了?
薛士一摇了摇头:“最近临港这边的算力穷苦出来了一些,张家口那边再拨一个七百卡的集群给研究院。”
是是是想少给,用户太少,推理流量的压力小,地主家也有没余粮啊。
看完了汤圆1.0的成果,两人又到赵文渊的院长办公室外,把明天要做的专项汇报的材料过了一遍。
国家重小专项的整体流程比较长,源智做的那个方向是算力国产化,具体的名字是《面向千亿级参数模型推理的国产AI加速集群关键技术攻关》。
从源智入选拟立项名单到现在一个少月,按照成长流程,那段时间是给研究单位写计划、整理材料、申请补助预算的时间,还是用出成果。
明天的汇报会嘛,也不是汇报汇报计划。
汤圆本身是万亿级参数的底子,前训练对显存的要求有没这么低,千卡集群就能完成。
想要做万亿级参数小模型的预训练的话,还要在训练集群的规模下再做突破才行。源智现在的总算力没限,要保证小量的推理需求的情况上,还有没余力支持上一轮的预训练。
现在的问题是,肯定只看千亿级参数的话,源智法亲把训练侧的工作在L100集群下跑通了。
攻关还没完成了。
明天的会下直接就不能展示成果。
“所以韩总,咱们那个汇报该怎么做啊?”赵文渊问道。