arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

2025-11-26 至 2025-11-26 共收录 33
2511.20604 2025-11-26 cs.CL cs.AI cs.LG

On Evaluating LLM Alignment by Evaluating LLMs as Judges

通过评估LLM作为裁判来评估LLM对齐

Yixin Liu, Pengfei Liu, Arman Cohan

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。

Comments NeurIPS 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20570 2025-11-26 cs.RO cs.AI cs.HC cs.LG

Gated Uncertainty-Aware Runtime Dual Invariants for Neural Signal-Controlled Robotics

门控不确定性感知的实时双不变量框架用于神经信号控制的机器人

Tasha Kim, Oiwi Parker Jones

机构 * Oxford Robotics Institute (ORI)(牛津机器人研究所) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

AI总结 GUARDIAN通过结合校准置信度的脑信号解码与符号目标接地和双层运行时监控,实现神经信号控制机器人系统的高安全性和可靠性。

Comments Embodied and Safe-Assured Robotic Systems workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20315 2025-11-26 cs.LG cs.AI cs.CL

Geometry of Decision Making in Language Models

语言模型中决策机制的几何学

Abhinav Joshi, Divyanshu Bhatt, Ashutosh Modi

AI总结 本研究通过分析语言模型中隐藏表示的内在维度,揭示了模型如何通过低维流形结构实现多选问答任务中的决策过程,提供了语言模型泛化和推理机制的几何学视角。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20273 2025-11-26 cs.LG cs.AI cs.CL

Beyond Components: Singular Vector-Based Interpretability of Transformer Circuits

超越组件:基于奇异向量的Transformer电路可解释性

Areeb Ahmad, Abhinav Joshi, Ashutosh Modi

机构 * Indian Institute of Technology Kanpur (IIT Kanpur)(印度理工学院坎浦尔(IIT坎浦尔))

AI总结 本文提出基于奇异向量的Transformer电路可解释性方法,揭示了模型内部更分布、结构化和组合化的计算特性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20194 2025-11-26 cs.LG

In-Context Compositional Learning via Sparse Coding Transformer

基于稀疏编码的上下文组合学习变换器

Wei Chen, Jingxi Yu, Zichen Miao, Qiang Qiu

机构 * Purdue University(普渡大学)

AI总结 本文提出基于稀疏编码的变换器,通过稀疏注意力机制提升组合学习任务的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19808 2025-11-26 cs.LG cs.AI

Learning to Clean: Reinforcement Learning for Noisy Label Correction

学习以清洁:用于噪声标签纠正的强化学习

Marzi Heidari, Hanping Zhang, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡莱顿大学计算机科学学院) CIFAR AI Chair, Amii(CIFAR人工智能主席,Amii)

AI总结 本文提出了一种基于强化学习的噪声标签纠正方法,通过深度特征表示策略网络实现标签纠正,实验表明其在多个数据集上优于现有技术。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19684 2025-11-26 cs.CV cs.AI cs.HC cs.RO

IndEgo: A Dataset of Industrial Scenarios and Collaborative Work for Egocentric Assistants

IndEgo:工业场景及协作工作的人际助理数据集

Vivek Chavan, Yasmina Imgrund, Tung Dao, Sanwantri Bai, Bosong Wang, Ze Lu, Oliver Heimann, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) Technical University of Berlin(柏林技术大学) University of Tübingen(图宾根大学) RWTH Aachen University(亚琛工业大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

AI总结 IndEgo数据集旨在通过工业场景中的协作工作提升人机交互助理的多模态理解与错误检测能力。

Comments Accepted to NeurIPS 2025 D&B Track. Project Page: https://indego-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19671 2025-11-26 cs.AI

FISCAL: Financial Synthetic Claim-document Augmented Learning for Efficient Fact-Checking

FISCAL: 金融合成声明-文档增强学习用于高效事实核查

Rishab Sharma, Iman Saberi, Elham Alipour, Jie JW Wu, Fatemeh Fard

机构 * Charli Capital(Charli资本) University of British Columbia(不列颠哥伦比亚大学) Michigan Technological University(密歇根技术大学)

AI总结 FISCAL通过生成领域特定合成数据和高效微调,使小型模型在金融事实核查任务中达到最先进的准确性、鲁棒性和可扩展性。

Comments 3 tables, 11 pages, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19635 2025-11-26 cs.SE cs.LG

Agint: Agentic Graph Compilation for Software Engineering Agents

Agint:软件工程代理的代理图编译

Abhi Chivukula, Jay Somasundaram, Vijay Somasundaram

AI总结 Agint通过代理图编译器和运行时实现高效、可靠的软件工程代理,支持自然语言到代码的自动化转换与协作开发。

Comments 18 pages, 5 figures, NeurIPS 2025: Deep Learning for Code in the Agentic Era

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19431 2025-11-26 cs.CV physics.ao-ph

Cloud4D: Estimating Cloud Properties at a High Spatial and Temporal Resolution

Cloud4D: 高空间和时间分辨率下云特性估计

Jacob Lin, Edward Gryspeerdt, Ronald Clark

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学) Department of Physics Imperial College London(物理系伦敦帝国学院)

AI总结 Cloud4D通过同步地面相机和2D-3D变换器,实现了高空间和时间分辨率的云特性估计,提升空间-时间分辨率并保持高精度。

Comments NeurIPS 2025 Spotlight, project page: https://cloud4d.jacob-lin.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21945 2025-11-26 cs.LG

Generalization Bounds for Rank-sparse Neural Networks

秩稀疏神经网络的泛化界限

Antoine Ledent, Rodrigo Alves, Yunwen Lei

AI总结 本文研究了秩稀疏神经网络的泛化界限,证明了利用权重矩阵近似低秩结构的神经网络的泛化界限,并探讨了Schatten p准范数在不同p值下的影响。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07664 2025-11-26 cs.LG cs.DC

FedQS: Optimizing Gradient and Model Aggregation for Semi-Asynchronous Federated Learning

FedQS: 优化联邦学习中梯度与模型聚合的半异步方法

Yunbo Li, Jiaping Gui, Zhihang Deng, Fanchao Meng, Yue Wu

AI总结 FedQS通过分而治之策略优化半异步联邦学习中的梯度与模型聚合,提升准确性、稳定性和收敛速度。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01508 2025-11-26 cs.LG

Realistic CDSS Drug Dosing with End-to-end Recurrent Q-learning for Dual Vasopressor Control

面向真实临床环境的CDSS药物剂量优化:基于端到端递归Q学习的双血管加压素控制

Will Y. Zou, Jean Feng, Alexandre Kalimouttou, Jennifer Yuntong Zhang, Christopher W. Seymour, Romain Pirracchio

机构 * University of California, San Francisco(加州大学旧金山分校) Engineering Science, University of Toronto(多伦多大学工程科学系) University of Pittsburgh(匹兹堡大学)

AI总结 本文提出一种端到端递归Q学习方法,用于ICU中双血管加压素的剂量优化,通过设计动作空间提升可解释性与临床实用性。

Comments 13 pages, 5 figures. Neurips 2025 Workshop Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18847 2025-11-26 cs.CL cs.AI

ConfTuner: Training Large Language Models to Express Their Confidence Verbally

ConfTuner: 训练大型语言模型以口头表达其置信度

Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

AI总结 ConfTuner通过引入标记化布里尔分数损失函数,有效提升大型语言模型的置信度校准能力,适用于多种推理任务并泛化至黑盒模型。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17681 2025-11-26 cs.LG cs.AI

Unlearning as Ablation: Toward a Falsifiable Benchmark for Generative Scientific Discovery

反例作为消去:面向生成科学发现的可证伪基准

Robert Yang

机构 * S6 Research(S6研究)

AI总结 本文提出'反例作为消去'作为可证伪基准,旨在检验AI在科学发现中的生成能力,通过系统移除目标结果并评估模型能否重新推导,推动AI-科学的基准发展。

Comments 6 pages + appendix. Accepted to NeurIPS 2025 AI4Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22565 2025-11-26 stat.ML cs.LG math.OC

Adjoint Schrödinger Bridge Sampler

伴随施罗德inger桥采样器

Guan-Horng Liu, Jaemoo Choi, Yongxin Chen, Benjamin Kurt Miller, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR) Georgia Institute of Technology(佐治亚理工学院)

AI总结 ASBS是一种基于施罗德inger桥的新型扩散采样器,通过伴随匹配方法实现高效采样,无需估计目标样本,适用于多种能量函数和分子分布。

Comments NeurIPS 2025 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08640 2025-11-26 cs.CV

Orientation Matters: Making 3D Generative Models Orientation-Aligned

方向至关重要:使3D生成模型方向对齐

Yichong Lu, Yuzhuo Tian, Zijin Jiang, Yikun Zhao, Yuanbo Yang, Hao Ouyang, Haoji Hu, Huimin Yu, Yujun Shen, Yiyi Liao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出方向对齐的3D物体生成方法,通过构建Objaverse-OA数据集并微调两种生成模型,实现跨类别的方向一致性,提升下游任务性能。

Comments Accepted by NeurIPS 2025. Project Page: https://xdimlab.github.io/Orientation_Matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23575 2025-11-26 cs.AI cs.LG

CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring

CoT红手:链式推理监控的压力测试

Benjamin Arnav, Pablo Bernabeu-Pérez, Nathan Helm-Burger, Tim Kostolansky, Hannes Whittingham, Mary Phuong

机构 * LASR Labs(语言与语音研究实验室)

AI总结 本文提出了一种混合协议,通过结合模型推理和行动评分,提升链式推理监控在检测有害行为方面的性能。

Comments To be published in the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20426 2025-11-26 cs.CV

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16690 2025-11-26 cs.LG cs.AI

Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator

你的预训练大语言模型实际上是一个未监督的置信度校准器

Beier Luo, Shuoyuan Wang, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

AI总结 本文提出DACA方法,通过无监督方式优化后训练模型的置信度校准,减少不一致预测带来的过度自信问题,提升模型可靠性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14253 2025-11-26 stat.ME

Wavelet Canonical Coherence for Nonstationary Signals

小波典范相干性用于非平稳信号

Haibo Wu, Marina I. Knight, Keiland W. Cooper, Norbert J. Fortin, Hernando Ombao

AI总结 WaveCanCoh通过小波分析方法,用于研究非平稳信号中不同集群间的时变依赖关系,能有效捕捉瞬时频率特定的相互作用。

Comments Accepted at NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13858 2025-11-26 cs.LG

Enforcing Hard Linear Constraints in Deep Learning Models with Decision Rules

在深度学习模型中强制执行硬线性约束的决策规则

Gonzalo E. Constante-Flores, Hao Chen, Can Li

机构 * Davidson School of Chemical Engineering(戴维森化学工程学院) Purdue University(普渡大学)

AI总结 本文提出了一种模型无关的框架,通过结合任务网络和安全网络,强制深度学习模型在训练和推理过程中满足输入依赖的线性约束,同时保持高准确性和低计算成本。

Comments 1 figure

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14698 2025-11-26 cs.CV

Learning Efficient Fuse-and-Refine for Feed-Forward 3D Gaussian Splatting

学习高效的融合与细化用于前馈3D高斯散射

Yiming Wang, Lucy Chai, Xuan Luo, Michael Niemeyer, Manuel Lagunas, Stephen Lombardi, Siyu Tang, Tiancheng Sun

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

AI总结 本文提出了一种高效的融合与细化模块,通过混合Splat-Voxel表示减少冗余并适应动态场景,实现高效且实时的3D场景重建。

Comments NeurIPS 2025, Previously titled "SplatVoxel: History-Aware Novel View Streaming without Temporal Training", Project Page: https://19reborn.github.io/SplatVoxel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05718 2025-11-26 cs.AI cs.GR cs.LG cs.RO

RLZero: Direct Policy Inference from Language Without In-Domain Supervision

RLZero: 从语言直接推断策略而不使用领域内监督

Harshit Sikchi, Siddhant Agarwal, Pranaya Jajoo, Samyak Parajuli, Caleb Chuck, Max Rudolph, Peter Stone, Amy Zhang, Scott Niekum

AI总结 RLZero通过预训练的RL代理,无需领域内监督,直接从自然语言指令生成行为策略。

Comments NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08706 2025-11-26 cs.LG cs.AI

Searching Latent Program Spaces

在潜在程序空间中搜索

Matthew V Macfarlane, Clement Bonnet

机构 * University of Amsterdam(阿姆斯特丹大学)

AI总结 本文提出LPN,一种在测试时直接构建程序搜索能力的神经网络,通过学习隐含程序空间实现高效适应新任务。

Comments NeurIPS 2025 spotlight. Code available at https://github.com/clement-bonnet/lpn

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01778 2025-11-26 cs.LG math.AT

TopER: Topological Embeddings in Graph Representation Learning

TopER: 图表示学习中的拓扑嵌入

Astrit Tola, Funmilola Mary Taiwo, Cuneyt Gurcan Akcora, Baris Coskunuzer

机构 * Department of Mathematics(数学系) Florida State University(佛罗里达州立大学) Department of Statistics(统计系) University of Manitoba(曼尼托巴大学) AI Institute(人工智能研究所) University of Central Florida(佛罗里达大学中央分校) Department of Mathematical Sciences(数学科学系) University of Texas at Dallas(德克萨斯大学达拉斯分校)

AI总结 TopER通过拓扑数据分析实现低维图嵌入,提升图数据的可解释性和可视化效果,同时在分类和聚类任务中取得优异性能。

Comments 27 pages, 10 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16441 2025-11-26 cs.LG stat.ML

Categorical Flow Matching on Statistical Manifolds

统计流匹配在统计流形上的应用

Chaoran Cheng, Jiahan Li, Jian Peng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学)

AI总结 统计流匹配通过几何视角在统计流形上实现精确似然计算,提升复杂模式学习能力。

Comments Accepted to NeurIPS 2024 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏