arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-08-25 至 2026-08-25 共收录 17
2608.23552 2026-08-25 cs.AI cs.CL cs.SE 新提交

Prime Agent: A Self-Improving RLM Harness

Prime Agent:一种自改进的RLM管控框架

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch, Daniel Auras, Mika Senghaas, Fares Obeid, Konstantin Dunas, Johannes Hagemann, Sami Jaghouar

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Prime Intellect

AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。

Comments 16 pages, 10 figures. Technical report. Code: this https URL (https://github.com/PrimeIntellect-ai/prime-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23525 2026-08-25 cs.AI 新提交

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试

Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao

机构 * NUIST(南京信息工程大学) HKU(香港大学) McGill(麦吉尔大学) HKUST(GZ)(香港科技大学(广州)) Georgia Tech(佐治亚理工学院) NUS(新加坡国立大学) Tsinghua(清华大学) Griffith(格里菲斯大学) UT Austin(德克萨斯大学奥斯汀分校) MIT(麻省理工学院)

AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23322 2026-08-25 cs.LG 新提交

Beyond Point Predictions: Uncertainty-Aware Satellite Poverty Mapping for Public Policy

超越点预测:面向公共政策的不确定性感知卫星贫困制图

Markus B. Pettersson, James Bailie, Mohammad Kakooei, Eagon Meng, Adel Daoud

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Linköping University(林雪平大学) Karlstad University(卡尔斯塔德大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究针对非洲高分辨率贫困数据不足的问题,提出不确定性感知的EO-ML贫困制图方法,生成统计可靠的预测区间,还开发了风险可控的援助分配程序,为政策制定提供可靠补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22852 2026-08-25 cs.AI cs.CL q-fin.GN 新提交

Your AI, On a Dial: Controlling Investment Bias in LLMs with a Single Neuron

你的AI,可调节的旋钮:用单个神经元控制大语言模型的投资偏差

Sahong Park, Suhwan Park, Hoyoung Lee, Gakyung Kwon, Wonbin Ahn, Jaewon Choi, Alejandro Lopez-Lira, Yoon Kim, Chanyeol Choi, Hyeongwoo Kong, Yongjae Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) UNIST(蔚山科学技术院) LG AI Research(LG AI研究院) Hanwha Life(韩华生命保险) University of Florida(佛罗里达大学) Massachusetts Institute of Technology(麻省理工学院) LinqAlpha

AI总结 本研究提出投资偏差旋钮这一推理时单个神经元干预方法,可在不修改提示或参数的情况下,稳定校准LLM的整体投资立场,且适用于不同场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22154 2026-08-25 cs.LG 新提交

More accurate behavioral predictions with hybrid Bayesian-connectionist models

结合贝叶斯-联结主义的混合模型实现更准确的行为预测

Brenden M. Lake, Akshay K. Jagadish, Guangyuan Jiang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出带行为调优的贝叶斯蒸馏(BBT)混合模型,结合贝叶斯与神经网络模型优势,在人类概念学习案例中更准确预测人类行为并揭示心理学洞见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21841 2026-08-25 cs.AI cs.HC 新提交

AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations

AI 看门狗:用于检测和防御 AI 对话中操纵性黑暗模式的智能体接口

Rachel Poonsiriwong, Chayapatr (Pub) Archiwaranguprok, Constanze Albrecht, Monchai Lertsutthiwong, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) KASIKORN Labs(Kasikorn实验室)

AI总结 本研究提出 AI Watchdog 浏览器智能体接口,可检测对话式 AI 的五类黑暗模式,实验发现无认知强制的即时警告能显著降低用户对含黑暗模式的 AI 引导建议的依从性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21544 2026-08-25 cs.CL cs.AI 新提交

Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents

权重中遗忘,工具中恢复:面向大语言模型智能体的智能体工具遗忘

Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Notre Dame(圣母大学) Johns Hopkins University(约翰斯·霍普金斯大学) Northwestern University(西北大学) MIT(麻省理工学院)

AI总结 该研究针对大语言模型智能体的工具介导恢复问题,提出两阶段的Agentic Tool Unlearning框架,在RWKU和MUSE数据集上实现了更好的遗忘与保留效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21584 2026-08-25 cs.AI cs.CE math.NA 新提交

Data-Driven Dynamic Algorithm Dispatch with Large Language Models

基于大语言模型的数据驱动动态算法调度

Rushil Shah, Emmanuel Lujan, Rabab Alomairy, Alan Edelman

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出基于LLaMA 3等的LLM驱动方法,结合性能数据库生成线性代数动态算法调度启发式算法,经LU分解案例验证可复制专家策略,为算法发现及自适应线性代数软件开发提供新方向。

Comments 3 pages, 2 figures. Accepted at the 2025 IEEE High Performance Extreme Computing Conference (HPEC). Outstanding Short Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21998 2026-08-25 cs.LG math.NA physics.ao-ph 新提交

DySCo: Dynamically consistent data-driven downscaling of extremes in climate projections

DySCo:气候预测中极端事件的动态一致数据驱动降尺度方法

S. Stamatelopoulos, M. Wang, I. Lopez-Gomez, L. Zepeda-Nunez, Z. Y. Wan, R. Carver, F. Sha, T. P. Sapsis

机构 * Massachusetts Institute of Technology(麻省理工学院) City University of Hong Kong(香港城市大学) Google Research(谷歌研究院)

AI总结 针对气候降尺度中动态一致性缺失的挑战,提出DySCo框架,通过数据驱动的张弛法重构训练动态配对轨迹,训练两阶段算子,在保持统计性能的同时提升动态一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21752 2026-08-25 cs.LG cond-mat.dis-nn cs.IT 新提交

Width-Independent Compressibility of Deep Neural Networks

深度神经网络的与宽度无关的可压缩性

Hong-Yi Wang, Mingze Wang, Liu Ziyin

机构 * Princeton University(普林斯顿大学) Peking University(北京大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究针对深度多层感知机证明了与原网络宽度无关的可压缩性定理,提出含导数匹配技术与逐层重加权的构造方法,得出压缩宽度量级公式,为神经网络压缩提供理论支撑。

Comments 11 pages main text, 28 pages total, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19583 2026-08-25 cs.CV cs.AI 版本更新

VGI-Bench: Probing Visual Intelligence in Video Generation Models

VGI-BENCH:探究视频生成模型的视觉智能

Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Jize Jiang, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Massachusetts Institute of Technology(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所) Microsoft Research(微软研究院) Etude AI

AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-08-25 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-08-25 cs.CL cs.CR 版本更新

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-08-25 cs.RO cs.AI cs.LG 版本更新

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21622 2026-08-25 cs.AI 版本更新

TO-Agents: A Multi-Agent AI Framework for Subjective Preference-Guided Topology Optimization

TO-Agents:一种用于基于偏好的拓扑优化的多智能体AI流水线

Isabella A. Stewart, Hongrui Chen, Faez Ahmed

机构 * Department of Mechanical Engineering Massachusetts Institute of Technology Cambridge, MA, 02139 USA(机械工程系 马萨诸塞理工学院 哥伦布, 马萨诸塞州, 02139 美国)

AI总结 本文提出TO-Agents,一种多智能体AI框架,通过将自然语言设计意图与迭代拓扑优化相结合,解决设计者手动转换非直接关联的偏好到求解器设置的问题,并在两个长周期设计任务中验证了其有效性。

Comments Accepted for publication in the Proceedings of the ASME 2026 International Design Engineering Technical Conferences (IDETC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03927 2026-08-25 cond-mat.mes-hall cond-mat.str-el cs.AI 版本更新

First-Principles AI finds crystallization of fractional quantum Hall liquids

从原理出发的AI发现分数量子霍尔液体的结晶

Ahmed Abouelkomsan, Liang Fu

机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, MA-02139, USA(麻省理工学院物理系)

AI总结 MagNet 通过从原理出发的 AI 方法,在强朗德-勒夫混合 regime 中发现分数量子霍尔液体和电子晶体的基态。

Comments 5 pages + SM. Published version in PRX Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15873 2026-08-25 cs.AI cs.CY 版本更新

Practical Principles for AI Cost and Compute Accounting

AI成本与计算核算的实用原则

Stephen Casper, Luke Bailey, Tim Schreier

机构 * MIT CSAIL Stanford University(斯坦福大学) Future of Life Institute(未来生命研究所)

AI总结 针对AI成本与计算核算存在的技术模糊性漏洞,提出七条原则以减少策略性博弈、避免抑制风险缓解并实现跨主体的一致实施,保障相关监管的有效性。

Comments Accepted to the ICML 2025 TAIG Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏