第(1/3)页 会议室的门被推开,各部门高管带着兴奋的劲头陆续离开。 顾屿站在原地整理了一下桌上的资料。 他抬起头看向还未起身的林溪和任少卿。 “你们两个先别走,来我办公室一趟。” 林溪和任少卿跟着顾屿来到顶层的董事长办公室。 办公室的装修十分简洁,没有多余的陈设。 林溪轻车熟路地走到茶水台前,拿了两个杯子倒热水。 任少卿抱着那台测试用的平板电脑坐在沙发上,眼睛还在盯着屏幕上的代码输出。 “天问三号这一波收敛确实做得漂亮。” 顾屿在单人沙发上坐下,端起林溪递过来的水杯喝了一口。 “不过你们不能松懈,这只是个基础大纲。” 任少卿抬起头,推了一下鼻梁上的黑框眼镜。 “顾董,你是不是又有什么新想法了?” “现在的逻辑推演能力已经达到了我们预期的上限。” “继续加大算力去跑,边际效益在递减。” “我们需要新的训练方向。” 顾屿放下水杯,双手交叉放在膝盖上。 “下一步计划,必须加强多模态能力。” “现在的AI,能听懂语音,能输出语音,这也算多模态的起步。” “图片识别勉强也能做到,给它一张猫的图片,它能认出是猫。” “但是这远远不够。” 林溪在旁边坐下,手里拿着记录本。 “那还要认什么?” “认视频。”顾屿看着任少卿。 任少卿眼角跳动了一下。 他的脸色变得有些严肃。 “视频识别?” “顾董,这工作量有点大啊。” “视频本质上是连续的图像帧序列。” “光是处理单张图片就非常消耗算力,加上时间维度,数据量是几何倍数的增长。” “而且还需要模型理解动作的时序逻辑。” “难也得干。”顾屿语气平稳。 “天问三号要成为全能型AI,就不能是个瞎子。” “你们回去之后,把这个任务拆解一下。” 任少卿没有推辞,拿笔在笔记本上记了下来。 “行,这事交给我,我回去拉个小组专门攻坚视频多模态。” 顾屿看着任少卿记完,又抛出了第二个重磅炸弹。 “除了视频识别,接下来你和楼天城还得再分出一个人来。” “单独去搞一个全新的分支项目。” “什么项目?”任少卿停下笔。 “文生图。”顾屿吐出三个字。 任少卿有些意外。 “文生图?” “用自然语言直接生成图像?” 顾屿点了点头。 “没错。我们手里现在已经掌握了庞大的文字语料。” “接下来要把文字和图像的对齐数据管道建起来。” “这是一个极具商业潜力的赛道。” 林溪在旁边听到这里,眼睛亮了一下。 “如果真能做到输入文字就生成高质量图片。正好呼应了刚才老钱在会上说的痛点。” “那我们海量引擎那边的广告素材生成,就直接从文字升级到视觉层面了,这能省下多少美工和设计费啊。” “思路是对的。”顾屿看着任少卿。 “你脑子里现在有没有什么研发方向?” 任少卿思考了片刻,习惯性地扶了一下眼镜。 第(1/3)页