arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

至 收录 17318
2606.29792 2026-06-30 cs.CL

Are Humans Evolved Instruction Followers? An Underlying Inductive Bias Enables Rapid Instructed Task Learning

人类是进化而来的指令遵循者吗?一种潜在的归纳偏置使得快速指令任务学习成为可能

Anjishnu Kumar

机构 * Amazon Alexa AI Seattle, USA(亚马逊Alexa AI西雅图美国)

AI总结 本文提出人类具有进化形成的指令遵循偏置,即一种归纳偏置,使得从语言快速泛化行为成为可能,并类比大语言模型的指令微调,呼吁跨学科研究。

Comments 4 pages, Position Paper, Published at Neurips 2025 Workshop on Interpreting Cognition in Deep Learning Models - https://neurips.cc/virtual/2025/loc/san-diego/129741

URL PDF HTML 收藏
2509.23292 2026-06-30 cs.AI cs.CL

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

学习如何使用工具,而非仅仅何时:基于模式的工具集成推理

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang

机构 * University of Georgia(佐治亚大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) The University of Hong Kong(香港大学)

AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。

Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

URL PDF HTML 收藏
2512.10359 2026-06-30 cs.CV cs.AI

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

URL PDF HTML 收藏
2511.16340 2026-06-30 cs.LG stat.ML

Warm-Starting Iterative Gaussian Processes for Faster Sequential Inference

基于 warm-start 的迭代高斯过程用于更快的序列推理

Alan Yufei Dong, Jihao Andreas Lin, José Miguel Hernández-Lobato

AI总结 本文提出三种 warm-start 策略,通过利用更小线性系统解加速后验更新,提升高斯过程在序列任务中的效率,实验证明在回归和贝叶斯优化中具有显著速度提升和精度提升。

Comments Previous version appeared as Improving Iterative Gaussian Processes via Warm Starting Sequential Posteriors in SPIGM Workshop, NeurIPS 2025

URL PDF HTML 收藏
2503.09679 2026-06-30 cs.LG cs.CV

DRESS: Disentangled Representation-based Self-Supervised Meta-Learning for Diverse Tasks

DRESS:基于解耦表示的自监督元学习方法用于多样化任务

Wei Cui, Tongzi Wu, Jesse C. Cresswell, Yi Sui, Keyvan Golestan

机构 * Layer 6 AI

AI总结 本文提出DRESS,一种基于解耦表示的自监督元学习方法,通过生成自监督任务加速模型在多样化少样本任务上的适应,验证了其在多个数据集上的优越性。

Comments 12 pages, 12 figures (including figures in the Appendix). An earlier version of the paper has been presented at the Self-Supervised Learning workshop at the 2024 NeurIPS conference

URL PDF HTML 收藏
2606.27862 2026-06-29 cs.CV 新提交

ScaLe-INR: Scale and Learn Implicit Neural Representations

ScaLe-INR:尺度化与学习隐式神经表示

Buwaneka Epakanda, Athulya Ratnayake, Pandula Thennakoon, Mario De Silva, Avishka Ranasinghe, Roshan Godaliyadda, Parakrama Ekanayake

机构 * eng.pdn.ac.lk(彭达大学) ee.pdn.ac.lk(电子工程学院)

AI总结 提出多分支架构ScaLe-INR,通过方向坐标缩放匹配频谱与网络最优工作区域,并设计方向边缘引导损失消除频谱串扰,在图像、音频和3D重建任务上超越现有方法。

Comments Submitted as a conference paper to NeurIPS 2026

URL PDF HTML 收藏
2606.27538 2026-06-29 cs.CL cs.AI 新提交

The Context-Ready Transformer

上下文就绪变换器

Mahesh Godavarti

机构 * A Carrot, Inc(A Carrot公司)

AI总结 提出上下文就绪变换器,通过预上下文化标记和校正网络实现循环神经网络架构,在保持并行训练的同时提升推理速度,实验表明单层模型可超越6层标准变换器。

Comments NeurIPS, 22 pages

URL PDF HTML 收藏
2412.07380 2026-06-29 cs.CL cs.AI

SpecFuse: Ensembling Large Language Models via Next-Segment Prediction

SpecFuse:通过下一段预测进行大语言模型的集成

Bo Lv, Nayu Liu, Chen Tang, Xin Liu, Yue Yu, Ping Luo

机构 * Peng Cheng Laboratory(鹏城实验室) Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tianjin Laboratory Autonomous Intelligence Technology and Systems, School of Computer Science and Technology, Tiangong University(天津工业大学计算机科学与技术学院天津市自主智能技术与系统实验室) Institute for Advanced Algorithms Research, Shanghai(上海高级算法研究所)

AI总结 本文提出SpecEM框架,通过动态调整模型贡献提升集成效果,结合推测解码实现段级语义协作,实验表明在多个LLM家族和基准数据集上性能优于现有方法。

Comments 15 pages, 5 figures

Journal ref NeurIPS 2025

URL PDF HTML 收藏
2510.16492 2026-06-29 cs.CL 版本更新

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

URL PDF HTML 收藏
2606.26601 2026-06-26 cs.SI 新提交

Fast Computation and Optimization for Opinion-Based Quantities of Friedkin-Johnsen Model

Friedkin-Johnsen模型中基于意见的量的快速计算与优化

Haoxin Sun, Yubo Sun, Xiaotian Zhou, Zhongzhi Zhang

AI总结 针对FJ模型,提出基于部分有根森林的高效算法计算意见相关量,并用于意见最小化及极化与分歧最小化问题,将时间复杂度从线性降至亚线性。

Comments Published at NeurIPS 2025

URL PDF HTML 收藏
2605.20919 2026-06-26 cs.LG cs.AI cs.PL 版本更新

Sutra: Tensor-Op RNNs as a Compilation Target for Vector Symbolic Architectures

Sutra: 以张量操作RNN作为向量符号架构的编译目标

Emma Leonhart

机构 * Emma Leonhart

AI总结 Sutra是一种纯函数式编程语言,通过编译将整个程序降级为融合张量操作图,同时支持符号推理和神经网络训练,实现逻辑程序与可训练网络的统一。

Comments Modified NeurIPS submission, see AI declaration and replication materials at end of paper

URL PDF HTML 收藏
2409.01447 2026-06-26 cs.LG cs.GT 版本更新

Decentralized Best-Response-Based Learning in Two-Player Zero-Sum Stochastic Games: A Finite-Sample Analysis

两人零和随机博弈中基于最优响应的去中心化学习:有限样本分析

Zaiwei Chen, Kaiqing Zhang, Eric Mazumdar, Asuman Ozdaglar, Adam Wierman

机构 * Purdue University(普渡大学) University of Maryland, College Park(马里兰大学学院公园分校) Caltech(加州理工学院) MIT(麻省理工学院)

AI总结 本文对两人零和矩阵博弈和随机博弈中的去中心化学习进行有限样本分析,提出基于最优响应的学习算法,并证明其样本复杂度。

Comments A preliminary version [arXiv:2303.03100] of this paper, with a subset of the results that are presented here, was presented at NeurIPS 2023

URL PDF HTML 收藏
2606.24965 2026-06-25 cs.AI cs.LG 新提交

Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

Project Auto-World: 迈向神经关系推理器的自动化基准测试

Anirban Das, Joanne Boisson, Irtaza Khalid, Sumita Garai, Steven Schockaert

机构 * Cardiff University(卡迪夫大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。

Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules

URL PDF HTML 收藏
2606.25042 2026-06-25 cs.IT math.IT math.PR math.ST stat.ML stat.TH 新提交

Information from coincidences

来自重合的信息

Akshay Balsubramani

AI总结 本文证明了一个统一的代数混合重合恒等式,将信息论中多个变分结果(如Sanov分解、Chernoff信息、Donsker-Varadhan不等式等)作为特例,并推广到多先验情形,应用于语言模型和基因组序列分析。

Comments 78 pages, 16 figures, 7 tables. Submitted to NeurIPS 2026. A mixed coincidence partition function gives Sanov, Chernoff, PAC-Bayes, and Renyi as corollaries

URL PDF HTML 收藏
2606.24187 2026-06-25 cs.CV 新提交

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

AI总结 提出自适应无训练帧采样方法AdaQ,基于高斯分布3-σ规则动态调整采样区间,在仅用64帧下使Qwen3-VL-8B平均超越GPT4o 15.8%,显著提升长视频理解的鲁棒性和效率。

Comments NeurIPS 2026 submission. 15 pages, 8 figures

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

URL PDF HTML 收藏
2509.00704 2026-06-25 cs.LG cs.AI q-bio.QM 版本更新

Why Pool When You Can Flow? Active Learning with GFlowNets

为何池选,不如流选?基于GFlowNets的主动学习

Renfei Zhang, Mohit Pandey, Artem Cherkasov, Martin Ester

机构 * School of Computer Science, Simon Fraser University, Burnaby, BC, Canada(Simon Fraser大学计算机科学学院,Burnaby, BC, Canada) Vancouver Prostate Centre, University of British Columbia, Vancouver, BC, Canada(温哥华前列腺中心,不列颠哥伦比亚大学,Vancouver, BC, Canada) Faculty of Medicine, University of British Columbia, Vancouver, BC, Canada(不列颠哥伦比亚大学医学院,Vancouver, BC, Canada) Diagen AI

AI总结 提出BALD-GFlowNet框架,用生成流网络直接采样高信息分子,替代传统池选,实现与池大小无关的可扩展性,在虚拟筛选中达到与BALD相当的性能并生成更多样化分子。

Comments Accepted at the NeurIPS 2025 Workshop on AI Virtual Cells and Instruments: A New Era in Drug Discovery and Development (AI4D3 2025), San Diego, California, USA. 6 pages; 5 figures

URL PDF HTML 收藏
2506.05252 2026-06-25 cs.LG cs.GT cs.MA

Conservative classifiers do consistently well with improving agents: characterizing statistical and online learning

保守分类器在改进的智能体中表现一致:刻画统计和在线学习

Dravyansh Sharma, Alec Sun

机构 * Northwestern University(西北大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Alphabetical order(字母顺序) University of Chicago(芝加哥大学)

AI总结 本文研究了改进智能体对分类器的影响,提出了一种非对称的最小一致概念类,并在可实现设置中精确刻画了带改进的proper学习。通过欧几里得球改进集,解决了开放性问题,降低了泛化误差并改进了在线学习界限。

Comments 26 pages

Journal ref Advances in Neural Information Processing Systems (2025)

URL PDF HTML 收藏
2606.24650 2026-06-24 cs.CL cs.LG 新提交

Harmonic: Hierarchical State Space Models for Efficient Long-Context Language Modeling

Harmonic: 用于高效长上下文语言建模的分层状态空间模型

Petr Nyoma

机构 * Independent Researcher(独立研究员)

AI总结 提出分层状态空间模型Harmonic,通过堆叠三个不同时间尺度的循环层,每层接收下层预测误差而非原始隐藏状态,在长序列上显著优于Transformer和Mamba,并消除了RoPE位置编码限制。

Comments 12 pages, 8 figures. NeurIPS 2024 format

URL PDF HTML 收藏
2509.03647 2026-06-24 cs.CL cs.AI cs.LG 版本更新

Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

打破镜像:基于激活的LLM评估者自我偏好缓解方法

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) School of Computer Science(计算机科学学院)

AI总结 针对LLM评估者自我偏好偏见,提出轻量级引导向量方法,在推理时无需重训练即可将不公正自我偏好降低97%,但存在稳定性问题。

Comments Presented at {Mechanistic Interpretability, Evaluations, Reliable-ML} Workshops, NeurIPS 2025

URL PDF HTML 收藏
2606.22858 2026-06-23 cs.LG cs.AI 新提交

The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks

无形之手:通过目标身份重新关联攻击操纵模型公平性和SHAP

Sannaan Khan, Muhammad U. S. Khan

机构 * National University of Sciences and Technology (NUST)(国立科技大学(NUST))

AI总结 提出目标身份重新关联(TIRA)攻击,通过概率性微扰操纵模型输出,在不留痕迹的情况下扭曲公平性指标和SHAP解释。

Comments Accepted at NeurIPS Workshops 2025

URL PDF HTML 收藏
2606.22182 2026-06-23 cs.CV cs.AI 新提交

Dual-Stream EEG Decoding for 3D Visual Perception

用于3D视觉感知的双流脑电解码

Ninon Lizé Masclef, Taisija Demcenko, Antonella Catanzaro, Nataliya Kosmyna

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出一种模仿生物视觉腹侧和背侧通路的双流脑电解码模型,通过圆形回归预测角度和EEG条件多视图扩散实现3D重建,揭示了时间动态的通道参与模式。

Comments 17 pages, 4 figures. Accepted at the Symmetry and Geometry in Neural Representations Workshop (NeurReps), NeurIPS 2025. To appear in Proceedings of Machine Learning Research (PMLR)

URL PDF HTML 收藏
2510.01022 2026-06-23 cs.LG eess.SP stat.ML 版本更新

VDW-GNNs: Vector diffusion wavelets for geometric graph neural networks

VDW-GNNs:面向几何图神经网络的向量扩散小波

David R. Johnson, Alexander Sietsema, Rishabh Anand, Deanna Needell, Smita Krishnaswamy, Michael Perlmutter

机构 * Program in Computing, Boise State University, Boise, Idaho, USA(博伊西州立大学计算项目) Department of Mathematics, UCLA, Los Angeles, CA, USA(洛杉矶大学数学系) Department of Computer Science, Yale University, New Haven, CT, USA(耶鲁大学计算机科学系) Department of Genetics, Yale University, New Haven, CT, USA(耶鲁大学遗传学系) Department of Mathematics, Boise State University, Boise, Idaho, USA(博伊西州立大学数学系)

AI总结 提出向量扩散小波(VDW),受向量扩散映射算法启发,可有效融入几何图神经网络(VDW-GNNs),在合成点云和真实风场、神经活动数据上表现良好,并证明其具有框架理论和旋转平移对称性。

Comments Presented at ICML 2026. A previous, shorter version of this work was presented in the "New Perspectives in Advancing Graph Machine Learning" workshop at NeurIPS 2025

URL PDF HTML 收藏
2504.13161 2026-06-23 cs.CL

Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training

Nemotron-CLIMB: 基于聚类的迭代数据混合自助法用于语言模型预训练

Shizhe Diao, Yu Yang, Yonggan Fu, Xin Dong, Dan Su, Markus Kliegl, Zijia Chen, Peter Belcak, Yoshi Suhara, Hongxu Yin, Mostofa Patwary, Yingyan Lin, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出Nemotron-CLIMB方法,通过聚类和迭代优化提升预训练数据混合效果,实验显示其在预训练性能上优于现有模型,同时提供了一个大规模数据集用于研究。

Comments Accepted to NeurIPS 2025

URL PDF HTML 收藏
2510.16712 2026-06-23 cs.CL cs.AI 版本更新

The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models

LLM的变色龙本质:量化搜索增强语言模型中的多轮立场不稳定性

Shivam Ratnakar, Sanjay Raghavendra

机构 * University of Southern California(美国南加州大学)

AI总结 提出变色龙基准数据集和两个度量指标,揭示搜索增强LLM在多轮对话中因知识多样性不足而严重依赖查询框架,导致立场频繁摇摆。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MTI-LLM @ NeurIPS 2025

URL PDF HTML 收藏
2510.07314 2026-06-23 physics.plasm-ph cs.AI stat.ML 版本更新

GyroSwin: 5D Surrogates for Gyrokinetic Plasma Turbulence Simulations

GyroSwin:用于回旋动理学等离子体湍流模拟的五维代理模型

Fabian Paischer, Gianluca Galletti, William Hornsby, Paul Setinek, Lorenzo Zanisi, Naomi Carey, Stanislas Pamela, Johannes Brandstetter

机构 * ELLIS Unit, Institute for Machine Learning, JKU Linz(JKU林茨机器学习研究所ELLIS单元) United Kingdom Atomic Energy Authority, Culham campus(英国原子能局库勒姆校区) EMMI AI, Linz(林茨EMMI人工智能)

AI总结 提出GyroSwin,首个可扩展的五维神经代理模型,通过扩展层次视觉Transformer至五维、引入交叉注意力和集成模块以及基于非线性物理的通道分离,精确模拟回旋动理学湍流热输运,计算成本降低三个数量级。

Comments Accepted at NeurIPS 2025, First authors contributed equally

URL PDF HTML 收藏
2510.04646 2026-06-23 cs.LG cs.AI 版本更新

Predictive Feature Caching for Training-free Acceleration of Molecular Geometry Generation

预测性特征缓存用于分子几何生成的无训练加速

Johanna Sommer, John Rachwan, Nils Fleischmann, Stephan Günnemann, Bertrand Charpentier

机构 * PrunaAI

AI总结 提出一种无训练缓存策略,通过预测求解器步骤间的中间隐藏状态加速分子几何生成,在GEOM-Drugs数据集上实现2倍加速且质量不变,结合其他优化可达7倍。

Comments Accepted at the AI for Science Workshop @ NeurIPS 2025

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

URL PDF HTML 收藏
2506.04018 2026-06-23 cs.AI cs.CL cs.CY cs.LG 版本更新

AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性

Akshat Naik, Emma Gouné, Patrick Quinn, Guillermo Bosch, Francisco Javier Campos Zabala, Jason Ross Brown, Edward James Young

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学) Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne Université(索邦大学) The Leverhulme Centre for the Future of Intelligence(未来智能中心) University of Cambridge(剑桥大学) Independent Researcher(独立研究者) Department of Computer Science and Technology(计算机科学与技术系) Department of Engineering(工程系)

AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。

Comments Prepint, under review for NeurIPS 2025

URL PDF HTML 收藏