新闻动态

AI 通过自问自答就能提高推明智商?!
这恰是卡内基梅隆大学团队建议的新框架SQLM——一种无需外部数据的自我发问模子。

该框架包含发问者(proposer)息争答者(solver)两个变装,发问者生成与给定主题关联的问题,解答者旨在责罚问题。
网友们神评,"几乎是带有 RL 的 GAN "。

值得一提的是,此团队中又双叒叕现华东说念主身影~
通过强化学习最大化生机奖励
现时大言语模子的磨砺很猛进程上仍依赖东说念主奥密理数据集,号称费时起劲。
为了缩短这一背负,磋商东说念主员开发了用于强化学习的无监督奖励函数。然则,这些函数仍然依赖于事前提供的高质地输入教导。
因此,问题的难点从"生成谜底"动荡到了"生成高质地问题"。
这突显出现时要道的一个短处不及:
枯竭一种可彭胀且自我保管的经由,大致在无东说念骨干扰的情况下自动生成挑升旨的问题和谜底。

为此,磋商者建议了SQLM 框架,一种非对称的自我博弈框架,其中发问者,解答者回复该问题,两者均通过强化学习进行磨砺,以最大化生机奖励。
其中,发问者生成问题会对解答者酿成条目影响,而解答者的发达又反过来为发问者提供奖励,从而胁制优化发问者。
由于枯竭果然谜底,磋商者运筹帷幄了基于"生成者–考据者差距"的自监督奖励函数。
若生成器 - 考据器差距小(举例算数问题),则弃取大量投票行为代理奖励。

若生成器 - 考据器差距大(举例编程问题),先由发问者生成测试用例,奖励则基于通过测试的比例。

这种极小极大式的磨砺框架通过自博弈末端了踏实磨砺,并使奖励机制大致针对具体问题进行自符合颐养。
为了评估模子的不同智商,磋商者进行了三部分任务,并使用 Qwen2.5-3B-Instruct 启动现实。
算术任务
磋商东说念主员让发问者生成一个三位数的算数问题,并将其行为解答器的输入。他们按照 TinyZero 的开拓,构建了一组包含 4096 个三位数乘法问题的测试集。
代数任务
磋商者让模子生成最多包含两个变量的线性方程,并在 OMEGA 基准中的 100 说念线性方程测试题上进行评估。
编程问题
他们让模子生成近似 LeetCode 中浮浅题的问题,输入为整数列表,输出为单个整数或另一个列表,并在 Codeforces 测试集的一个子集上进行评估。

现实恶果清晰,SQLM 将 Qwen2.5-3B-Instruct 在算术任务上的准确率提高了 14%,在代数任务上提高了 16%;在编程任务上的准确率提高了 7%。
此外,上表还清晰出 SQLM 显耀优于形式奖励基线(用于踏实磨砺和设施输出形式的参考值),标明推明智商的信得过提高。
团队先容

Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。

Katerina Fragkiadaki,卡内基梅隆大学机器学习系忖度机科学副磨真金不怕火,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后磋商员,并于谷歌磋商院责任。

Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌 DeepMind 磋商员,行将出任卡内基梅隆大学机器学习系的助理磨真金不怕火。

Deepak Pathak,Skild AI 首创东说念主,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在 Meta 担任了一年的磋商员,现任卡内基梅隆大学忖度机科学学院的助理磨真金不怕火。
参考相接:
[ 1 ] https://x.com/iScienceLuvr/status/1953052817012474353
[ 2 ] https://arxiv.org/abs/2508.03682
一键三连「点赞」「转发」「留意心」
接待在驳斥区留住你的思法!
— 完 —
� � 但愿了解 AI 居品最新趋势?
量子位智库「AI 100」2025 上半年
「旗舰居品榜」和「鼎新址品榜」
给出最新参考� �
� � 点亮星标 � �
科技前沿进展逐日见九游体育app官网

