
编辑|杨文玉树家具封边胶厂家
AI圈不缺八卦。
这次的主角叫GiambattistaParascandolo,是OpenAI理模型向的重要研究者。
2020年,他去MIT面试教授岗位,做了场关于用GPT做理的报告。结果,面试委员会大部分教授把这个向斥为「稽之谈」(nonsense)。
这哥们直接贴脸开大,将这段经历写进了个人主页,并附上了当年的报告介绍和幻灯片链接。
https://sites.google.com/view/giambattista-parascandolo/home
那份被批「稽之谈」的报告,讲了啥?
MIT官网显示,这场报告的主题,是如何让人工经网络突破训练分布,获得接近人类的泛化和规划能力。
Parascandolo认为,人类能够重新组已有知识,识别关键不变量,建立抽象模型,并完成长时程规划。人工经网络在这些面仍有很大提升空间。
报告后,他提出了三个未来研究向:经网络中的开放式理、人工经网络中尚未探索的自由度,以及在强化学习中将语言作为理载体,以提样本率。
其中关键的概念,是「开放式理」。
Parascandolo将其定义为:模型可以投入多时间和计玉树家具封边胶厂家,持续修正答案。问题越难,模型就应该多想几步,并让额外计转化为好的结果。
这听起来已经很像今天的理时计扩展。
当时的标准Transformer拥有固定的网络度,每个token经历的前向计量基本确定,问题难度却与输入长度没有稳定关系。个问题可以很长,答案却很简单。另个问题只有句话,可能需要多轮拆解和验证。
RNN看起来加适这种任务。它可以反复运行,理论上能够获得任意长度的思考时间。Parascandolo在PPT中展示的曲线却表明,RNN通常只在训练时见过的理步数附近表现好,继续增加循环次数,准确率反而可能下降。
这意味着,增加计量只是步,模型还要学会如何利用这些计。
当时果强的多步规划,大量依赖模型预测控制和蒙特卡洛树搜索。经网络负责预测环境或评估价值,外部搜索法负责展开未来路径。Parascandolo希望进步将长程理能力融入经网络。
他的二个设想,是让语言成为理载体。
Parascandolo用经典游戏《蒙特祖玛的复仇》举例。个从开始训练的强化学习Agent,需要尝试大量状态和动作组,很多正确操作本身并不复杂,Agent真正缺少的,是对「什么行为理」的判断。
GPT已经从文本中吸收了大量世界知识,语言可以帮助模型描述环境、理解目标、拆解任务和生成层计划,也能大幅缩小搜索范围。
放到今天,这套思路很容易让人联想到思维链、语言规划和Agent工作流。
Parascandolo提出的三个向是,人工智能系统可以重置任务,回到记忆中的任意状态,构造反事实场景,万能胶生产厂家还可以调整模拟器中的时间、重力和观察结果。系统甚至可以直接读取、复制和修改自身的激活值与经网络权重。
这相当于把学习过程本身也纳入Agent的操作空间。它可以开展刻意练习,生成特殊训练场景,迁移已有知识,并针对失败轨迹重新学习。
五年前的PPT里,几乎写出了今天的理模型路线。
我们还扒出了他2021年6月写过的篇博客,题目就是《反向传播、进化与「两只狗」的误区》。
这篇博客主要反驳「经网络需要海量数据,因此不像人脑」的观点。
Parascandolo认为,人类只看几只狗就能学会识别,并不代表此前没有积累经验。漫长的进化已经把祖先接触世界的经验,沉淀为人类大脑的结构和归纳偏置。
按照这视角,经网络的大规模预训练可以类比生物进化,模型微调和上下文学习才接近个体生中的学习。GPT-3读过的文本远任何个人,但其预训练承担了压缩海量经验、塑造学习能力的作用。因此,不能直接拿模型的全部预训练数据,与个人出生后的少量学习样本进行比较。
这种理解也意味着,继续扩大数据和力仍可能带来明显提升。他类比的是两者发挥的作用,并没有认为梯度下降与生物进化的具体机制相同。
这小哥啥来历?
这哥们相当低调,X上新条帖子还得追溯到2024年11月,当时他正在为o1招聘两位研究工程师(RE)和软件工程师(SWE)。
据他个人主页显示,Parascandolo的研究经历,直围绕泛化、规划和理展开。
2017年,他进入马克斯・普朗克智能系统研究所和苏黎世联邦理工学院攻读博士,师从BernhardSchölkopf和ThomasHofmann,博士课题聚焦度学习中的OOD泛化。
博士期间,他在山景城的GoogleX和伦敦的DeepMind各做过段实习,前者参与大规模模拟器上的自动化设计研究,后者参与分蒙特卡洛树搜索研究。
2021年9月博士毕业,他直接加入OpenAI,初进入JohnSchulman的强化学习团队,随后转向MarkChen所在的法团队,又加入JerryTworek带的(草莓)团队。草莓团队,正是o1项目的内部代号。
2023年,他参与GPT-4研发,并组建了支继续研究理的新团队。后来又参与了OpenAIo1和o3的基础研究,动励建模、环境构建和通用理法的扩展。其中部分法描述,至今仍被他用黑块遮住。
2020年那场面试,Parascandolo没能拿到MIT的教职,他去了OpenAI。
四年后,他帮助构建了o1。
人生总是妙不可言。相关词条:罐体保温施工 异型材设备 锚索 玻璃棉 保温护角专用胶
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定玉树家具封边胶厂家,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。