小字:「今天聊点什麽?」
……
十三楼模型组,赵文渊没有自己的办公室,和其他的同事一样坐在开放办公区。
小牛帮赵文渊把外卖的生椰拿铁拿过来的时候,他的眼睛还盯着屏幕上的日志。
他的工位旁边现在固定加了一把转椅,他和源码科技模型组的其他员工都已经习惯了——韩路一最近每天都会花几个小时坐在这里,跟他们一起写国产显卡的软体适配。
「文渊,怎麽样了?」
韩路一的声音传过来。
赵文渊闻声抬起头,看到韩路一正走过来。
「韩总,你可来了,你快坐。」赵文渊明显激动起来,「这两个算子我卡了半天了,你快看看吧。」
这是两人最近新形成的工作模式。
赵文渊带着手下的人用编程智能体做国产显卡的适配工作。
每个人都分到一个算子,先设计一个通过基准,一般来说能达到N卡的百分之八十就算达标,然後用智能体一轮一轮的试。虽然成功率不高,但是效率比手写已经大大提高了,试的多了也有一些迁移工作的效果不错。
碰上那些特别重要、特别难的,再汇报给赵文渊。
这种情况一般赵文渊也做不了什麽,他就等着韩路一来。
韩路一坐下之後认认真真的从上到下看一遍,然後就开始写,劈里啪啦的输入一串提示词,各种关键参数和逻辑都写在里面,然後回车,等五分钟。
这个难点就攻克了。
经历了最初的震惊、迷茫、怀疑世界之後,赵文渊已经适应了这种模式。
可能这个世界就是有天才吧。
有难题,找韩总。
我直接把韩总当我的随身老爷爷用不就完了吗?管他怎麽做到的呢。
像现在,卡了全组两天的两个算子迁移,韩路一坐下十分钟,解决了。
第一个是RoPE。
这个东西说白了,是让模型知道一段文本里每个词所在的位置。短文本里问题不明显,可一旦上下文拉长到十六K,显卡那边的三角函数近似误差就开始增多的厉害。之前测试的时候,前八K还算正常,到了後面,生成结果就会出现莫名其妙的错位。
赵文渊他们试了两天,一直在精度和性能之间来回拉扯。精度压下去,速度掉得厉害;速度提上来,误差又爆。
韩路一坐下之後,只看了一遍日志,就让智能体把sin/cos查表的粒度重新切了一档,又把缓存策略改成按block复用。
五分钟後,十六K长上下文测试通过,性能损耗从原来的百分之四十七降到了百分之十八。
第二个是LayerNorm。
这个算子看起来简单,可训练里调用频率极高,慢一点点,整条训练链路都会被拖住。韩路一改了两个访存顺序,又让智能体把向量化读写补上,性能直接从N卡基准的百分之五十二拉到百分之八十一。
赵文渊当时看着那两个绿色 PASS,心情已经很平静了。
平静到有点麻木。
解决完问题,韩路一制止了赵文渊想要接着工作的势头。
「停一下,我有别的事要和你商量。」
赵文渊看向韩路一。
「Nexus那边开始动作了,我预测他们四月开始就不会再给我们提供API接口,所以在那之前我们要把汤圆1.0做出来,确保汤圆能接住Kaiwu海外版迁移过来的流量。」
赵文渊听完之後在电脑上切了一下屏幕,看了看训练进度,然後对韩路一说:「韩总,时间上有点赶,但是应该来得及。只是,我比较担心的是双语适配问题。」
赵文渊调整了一下坐姿,面向韩路一,谨慎的分析起来。
「预训练倒是问题不大,用的网际网路上的原始数据,本身就是英文居多。关键是後训练,模型的理解能力主要来源於後训练的提高,你现在提供的那批标注虽然质量极高,但都是中文的,对英文能力的提升恐怕……」
赵文渊的话没说完整,但意思到位了。
然後他用期待的眼神看向韩路一:「韩总,不知道英文的标注,你能不能——」
这就是赵文渊的新策略。
有需求,找韩总。
你别管他是怎麽解决的,反正他能给你解决。
直接问就完了。
韩路一看着赵文渊期待的眼神,沉默了一会儿,才缓缓地点了点头:「……你确保训练进度,标注的事,我来想办法。」
说完他起身走了。
赵文渊赶紧投入到工作之中。
刚才卡住的难题韩路一虽然解决了,但是他是简单粗暴的给出了正确答案,至於中间为什麽这麽做、和其他的替代方案比有什麽提升,这些都还是空白。
赵文渊现在要做的事是拿着问题和正确答案,补全中间的答题过程。这些对将来的研究和开发工作来说,都是至关重要的资料。
他知道,韩路一不做这些繁琐的工作不是因为不会,而是因为工作繁忙没有时间。
把这些资料整理好,就是他赵文渊体现价值的地方。
况且,给天才解的题写文档这件事,也不是谁都有机会做的啊。
想到这,赵文渊突然抬头看向韩路一离开的方向。
奇怪,他刚才的脚步,是不是看起来有点儿沉重?