arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

共收录 17367
2609.11022 2026-09-11 cs.CV cs.AI cs.CL cs.LG 新提交

New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models

新证据,相同选择:测试视觉语言模型中的物理实验选择

Sourajit Saha, Shubhashis Roy Dipta, Nobin Sarwar, Shaswati Saha, Yuxuan Jiang, Siyuan Li, Qiheng Wang

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of Georgia(佐治亚大学)

AI总结 本研究通过受控实验基准测试视觉语言模型在物理推理中能否根据新证据选择最优实验或直接回答,发现多数模型在行动切换上表现不佳,仅少数能正确决策。

Comments Under Review at PhysWorldAI @ NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25741 2026-09-11 stat.ML cs.LG 版本更新

Test time training enhances in-context learning of nonlinear functions

测试时间训练增强非线性函数的上下文学习

Kento Kuwataka, Taiji Suzuki

机构 * Department of Mathematical Engineering(数学工程系) Information Physics, The University of Tokyo, Tokyo, Japan(信息物理,东京大学,东京,日本)

AI总结 本文提出测试时间训练与上下文学习结合的方法,通过理论分析证明该方法能有效适应不同任务中的特征向量和链接函数变化,提升模型预测性能。

Comments Under review at NeurIPS 2026. 44 pages, 2 figures, appendix included; revised synthetic experiment, corrected mistakes, and added background section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18988 2026-09-11 cs.AI 版本更新

Timely Clinical Diagnosis through Active Test Selection

及时临床诊断中的主动测试选择

Silas Ruhrberg Estévez, Nicolás Astorga, Mihaela van der Schaar

AI总结 针对静态数据无法反映临床推理的问题,提出ACTMED框架,结合贝叶斯实验设计和大语言模型,动态选择最优测试,提高诊断准确性、可解释性和资源效率。

Journal ref Proceedings of the 39th International Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09417 2026-09-10 cs.CV 新提交

Vision-language models know more about agriculture than they show and rubric-grounded verifications close the gap

视觉语言模型对农业的了解比它们展现的更多,基于评分标准的验证弥合了这一差距

Earl Ranario, Jared Smith, Lars Lundqvist, Urmil Jatin Chandarana

机构 * University of California, Davis(加州大学戴维斯分校)

AI总结 本研究构建农业基准,发现VLM视觉编码器已具备足够特征,通过基于评分标准的验证和概率枢轴锦标赛,显著提升分类性能,揭示模型知识未充分展现。

Comments Submitted to the AI for Science Workshop (NeurIPS Workshops 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.08789 2026-09-09 cs.CY cs.AI cs.SE 新提交

Silent Revision: Measuring Undisclosed Change in the Safety Frameworks of Frontier AI Developers

静默修订:衡量前沿AI开发者安全框架中未披露的变更

Louis Yiven Zhu

机构 * University of Oxford(牛津大学)

AI总结 本研究提出静默修订率指标,通过分析十二家前沿AI开发者安全框架的版本语料,发现多数实质性变更未被披露,且削弱承诺的变更更常被静默处理,主张发布义务应附带枚举义务。

Comments 8 pages of main text plus appendices, 3 figures. Under review at the AI & Science workshop (AISciK), NeurIPS 2026. Corpus and code: https://github.com/louisyzhu/frontier-safety-framework-corpus

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.08106 2026-09-09 cs.LG q-fin.ST 新提交

Nyström Attention Matches Full Attention for Cross-Sectional Stock Prediction

Nyström 注意力在横截面股票预测中与全注意力相当

Kunhan Guo

机构 * The University of Hong Kong(香港大学)

AI总结 本文分解 MASTER 的股票间注意力,发现其近似均匀但低秩,Nyström 低秩近似可匹配全注意力性能,且注意力寻求互补而非相关性,大规模下跨股票模块无优势。

Comments 14 pages, 4 figures. A short version is under review at the TS-LIMITS workshop, NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07901 2026-09-09 cs.AI 新提交

Quantization Amplifies Determinism, Not Bias: Scale-Dependent Behavioral Effects of Serving-Time Weight Compression

量化放大确定性而非偏见:服务时权重压缩的尺度依赖行为效应

Dachi Kurtskhalia

AI总结 研究发现量化压缩模型权重时,8B模型输出多样性下降(确定性增强),而14B/32B模型出现风格漂移,但均未发现偏见增强,表明量化主要放大确定性而非偏见。

Comments 8 pages, 3 figures. Under review at the NeurIPS 2026 Workshop on Deployable Small Foundation Models (LIGHT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07876 2026-09-09 cs.CL cs.LG 新提交

LLM Layers Immediately Correct Each Other

LLM 层立即相互纠正

Arjun Patrawala, Jiahai Feng, Erik Jones, Jacob Steinhardt

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文发现相邻 Transformer 层通过 TLCM 机制系统性相互纠正,该机制在预训练中出现并自适应调节,可解释 SAE 特征低特异性及转码器优势。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07627 2026-09-09 cs.AI cs.CY cs.LG 新提交

Norms at a Price: Why RL-Based Alignment Can Promise Conditional Compliance at Best

有代价的规范:为何基于强化学习的对齐最多只能承诺条件性遵从

Kevin Baum, Rūta Binkytė, Felix Jahn

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Hamburg University of Technology (TUHH)(汉堡工业大学) University of Oxford(牛津大学) Oxford Internet Institute(牛津互联网研究所)

AI总结 本文论证基于强化学习的对齐训练只能保证条件性遵从,因评分机制无法区分观察与否,并提出以架构设计使违规不可行作为补救措施。

Comments 8 pages, currently under review at the NeurIPS 2026 workshop "Foundations of Agentic Systems Theory (FAST)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06922 2026-09-09 cs.CV 新提交

BEFORE THE FLIP: Measuring Hidden Score Shifts In Quantized Vision Language Models Before The Answer Changes for Visual Question Answering

在翻转之前:量化视觉语言模型中答案改变前的隐藏分数偏移测量用于视觉问答

Sourajit Saha, Shubhashis Roy Dipta, Shaswati Saha, Nobin Sarwar, Yuxuan Jiang

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

AI总结 本研究提出“在翻转之前”方法,测量量化视觉语言模型中答案不变时的隐藏分数偏移,发现4比特压缩比8比特更显著改变分数差距,但逐问题调整精度无可靠益处。

Comments Under Review at VLM4RWD @ NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06186 2026-09-09 cs.LG 新提交

Spectral Prioritized Sweeping in Nonstationary Reinforcement Learning

非平稳强化学习中的谱优先扫描

Hung Pham, Tuan Dam

机构 * Hanoi University of Science and Technology(河内科技大学)

AI总结 针对非平稳奖励下优先扫描的短视问题,提出基于图拓扑增强的谱优先扫描(GTA-PS/SPS),利用拉普拉斯逆扩散残差并自适应退火,实验证明其提升重规划效率。

Comments 40 page, neurips pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05818 2026-09-09 cs.AI cs.CY q-bio.QM 新提交

Agentic BAIM-LLM Evaluation (ABLE): Benchmarking LLM Use of Protein Design Tools

Agentic BAIM-LLM 评估(ABLE):对 LLM 使用蛋白质设计工具进行基准测试

Bryce Cai, Geetha Jeyapragasan, Samira Nedungadi, Jake Yukich, Seth Donoughe

机构 * SecureBio

AI总结 本文提出 ABLE 基准,评估 LLM 智能体在蛋白质设计中使用生物 AI 工具的能力,发现当前模型虽能降低设计门槛,但在规划与知识整合上仍不稳定。

Comments Last revised in February 2026; presented without further revision. An earlier revision at was presented at the NeurIPS 2025 Workshop on Biosecurity Safeguards for Generative AI; see https://openreview.net/forum?id=fDysOrWaGd

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05797 2026-09-09 cs.CL 新提交

Recall Is Not Protection: Evaluating Safety Monitors Against Model Compliance

召回并非保护:评估安全监控器对模型遵从性的效果

Sripad Karne

机构 * Columbia University(哥伦比亚大学)

AI总结 研究发现安全监控器在模型会遵从的有害提示上召回率显著更低,标准召回率高估了实际保护,应基于模型实际响应评估监控器。

Comments Submitted to the NeurIPS 2026 JUDGe Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06295 2026-09-09 cs.LG physics.bio-ph physics.chem-ph 版本更新

Reactive Flux Matching: Mechanism Discovery and Adaptive Sampling of Rare Events

反应通量匹配:稀有事件的机制发现与自适应采样

Rishal Aggarwal, David Ryan Koes, Nicholas M. Boffi, Eric Vanden-Eijnden

机构 * CMU-Pitt Program in Computational Biology(CMU-匹兹堡计算生物学项目) Dept. of Computational & Systems Biology University of Pittsburgh(计算与系统生物学系匹兹堡大学) Machine Learning Department Dept. of Mathematical Sciences Carnegie Mellon University(机器学习系数学科学系卡内基梅隆大学) Courant Institute, New York University(纽约大学Courant研究所) Machine Learning Lab Capital Fund Management(机器学习实验室资本基金管理)

AI总结 提出通量匹配框架,从反应轨迹数据中学习电流速度 u(z) 和标量势 h(z),用于识别反应路径和反应坐标,并实现自适应采样。

Comments 21 pages, 7 figures, submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12563 2026-09-09 cs.AI 版本更新

LOBERT: Generative AI Foundation Model for Limit Order Book Messages

LOBERT:用于限价订单簿消息的生成式AI基础模型

Eljas Linna, Kestutis Baltakys, Alexandros Iosifidis, Juho Kanniainen

机构 * Data Science Research Centre(数据科学研究中心) Tampere University(塔尔库大学)

AI总结 LOBERT提出了一种基于BERT架构的仅编码器基础模型,通过新颖的标记化方案处理限价订单簿消息,在预测中间价格和下一消息任务中表现领先,并缩短了上下文长度。

Comments Submission for NeurIPS 2025 GenAI in Finance Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25323 2026-09-09 cs.LG 版本更新

CDFlow: Building Invertible Layers with Circulant and Diagonal Matrices

CDFlow:利用循环矩阵与对角矩阵构建可逆层

Xuchen Feng, Siyu Liao

机构 * School of Integrated Circuits(集成电路学院) Sun Yat-sen University(中山大学)

AI总结 CDFlow利用循环矩阵与对角矩阵的乘积构造可逆线性层,降低参数与计算复杂度,实现高效密度估计,尤其适用于周期结构数据。

Comments Accepted at NeurIPS 2025. 10 pages, 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.10090 2026-09-09 cs.LG cs.AI stat.ML

Knowledge Distillation in Wide Neural Networks: Risk Bound, Data Efficiency and Imperfect Teacher

Guangda Ji, Zhanxing Zhu

机构 * Peking University(北京大学) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Data Science, Peking University(北京大学数据科学中心)

Journal ref Advances in Neural Information Processing Systems 33 (2020), pp. 20823-20833

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04635 2026-09-07 cs.LG 新提交

Too Rare to Learn: Prescribed Cyclone Tracks Degrade a Bay of Bengal Ocean Emulator

过于罕见而无法学习:规定的气旋轨迹会降低孟加拉湾海洋模拟器的性能

Sumaiya Islam

机构 * University of Dhaka(达卡大学)

AI总结 该研究发现,在孟加拉湾的神经海洋模拟器中,将气旋轨迹作为规定输入的U-Net模型性能劣于仅海洋模型,因气旋轨迹信号罕见致网络响应错误,替换为无风暴图可提升预报性能。

Comments 11 pages, 7 figures. In review at the NeurIPS 2026 Tackling Climate Change with Machine Learning workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04695 2026-09-07 astro-ph.HE cs.LG hep-ex 新提交

A Differentiable Neural Surrogate for Photon Propagation in Neutrino Telescopes

中微子望远镜中光子传播的可微神经代理模型

Felix J. Yu, Berthy T. Feng, Nicholas Kamp, Carlos A. Argüelles

机构 * Harvard University(哈佛大学) NSF IAIFI Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究针对中微子望远镜光子传播模拟计算成本高的问题,提出可微SIREN神经场模型candela,其模拟速度比现有方法快50-100倍,精度接近蒙特卡洛模拟,还可提供端到端梯度以优化散射介质特性。

Comments 9 pages, 5 figures. Submitted to the Sim2Sci Workshop @ NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07314 2026-09-07 physics.plasm-ph cs.AI stat.ML 版本更新

GyroSwin: 5D Surrogates for Gyrokinetic Plasma Turbulence Simulations

GyroSwin:用于回旋动理学等离子体湍流模拟的五维代理模型

Fabian Paischer, Gianluca Galletti, William Hornsby, Paul Setinek, Lorenzo Zanisi, Naomi Carey, Stanislas Pamela, Johannes Brandstetter

机构 * ELLIS Unit, Institute for Machine Learning, JKU Linz(JKU林茨机器学习研究所ELLIS单元) United Kingdom Atomic Energy Authority, Culham campus(英国原子能局库勒姆校区) EMMI AI, Linz(林茨EMMI人工智能)

AI总结 提出GyroSwin,首个可扩展的五维神经代理模型,通过扩展层次视觉Transformer至五维、引入交叉注意力和集成模块以及基于非线性物理的通道分离,精确模拟回旋动理学湍流热输运,计算成本降低三个数量级。

Comments Accepted at NeurIPS 2025, First authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02948 2026-09-04 cond-mat.mtrl-sci cond-mat.stat-mech cs.LG 新提交

FrOGS: Discrete Neural Sampler for Independent Alloy Configurations Across Chemical Conditions

FrOGS:适用于不同化学条件下独立合金构型的离散神经采样器

Kyucheol Min, Elyssa Hofgard, Tess Smidt

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出FrOGS混合离散神经采样器,耦合自回归模型与CTMC,可在多化学条件下训练单个模型,在二维伊辛模型、AgPd和CuAu相图上表现良好,能恢复CuAu₃相稳定范围,优于基线SEGAL。

Comments Submitted to the AI4Mat workshop at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18338 2026-09-04 cs.LG astro-ph.EP astro-ph.IM 版本更新

ThousandWorlds: A benchmark for climate emulation of potentially habitable exoplanets

ThousandWorlds: 一个用于潜在宜居系外行星气候模拟的基准数据集

Edward T. Stevenson, Mei Ting Mak, Eric Wolf, Denis E. Sergeev, Tobi Hammond, N. J. Mayne, Miles Cranmer

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) University of Colorado Boulder(科罗拉多大学博尔德分校) University of Bristol(布里斯托大学) Purdue University(普渡大学) University of Exeter(埃克塞特大学)

AI总结 为加速系外行星气候模拟,提出ThousandWorlds基准数据集,包含五个全球气候模型的约1800次模拟,用于评估机器学习模拟器在低数据、多模拟器参数到场回归任务中的性能。

Comments 10 pages main text, 30 pages references/appendix, plus NeurIPS checklist. Data at https://doi.org/10.57967/hf/8695. Code at https://github.com/edstevenson/ThousandWorlds

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21047 2026-09-04 cs.AI cs.CL cs.LG 版本更新

Grammar-Aligned Decoding

语法对齐解码

Kanghee Park, Jiayu Wang, Taylor Berg-Kirkpatrick, Nadia Polikarpova, Loris D'Antoni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出语法对齐解码(GAD)方法,通过适应性采样与近似期望未来(ASAp)算法,提升语法约束下生成输出的质量和概率匹配度。

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02302 2026-09-03 cs.AI cs.CL cs.LG 新提交

Improving Evaluation Realism with Inference-Time Compute and Deployment Scaffolds

利用推理时计算资源与部署框架提升评估真实性

Axel Ahlqvist, Richard Guan, Juan-Pablo Rivera, Adeline Kassler, Dmitrii Troitskii, Alexandra Souly, Kai Fronsdal, Robert Kirk, John Hughes

机构 * Meridian Visiting Researcher Programme(梅里登访问研究员计划) Cambridge Boston Alignment Initiative(剑桥-波士顿对齐倡议) UK AI Security Institute(英国人工智能安全研究所) Meridian Labs(梅里登实验室) Anthropic(Anthropic公司)

AI总结 针对模型对齐评估中存在的评估感知问题,提出批评细化与DISH两种技术,二者组合使用可更有效提升对齐评估的真实性。

Comments 70 pages, 43 figures, 4 tables (13 figures in the main text). Under review at NeurIPS 2026. Code: https://github.com/meridianlabs-ai/petri_dish and https://github.com/AxelAhlqvist1995/petri-bon ; reproduction assets: https://github.com/AxelAhlqvist1995/petri-realism-reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02083 2026-09-03 cs.LG cs.CL 新提交

XMerge: Cross-Axis Selection and Reconstructive Layer Merging for LLM Depth Compression

XMerge:用于大语言模型深度压缩的跨轴选择与重构层合并方法

Jundong Hu, Shekar Ramachandran

机构 * PayPal AI(PayPal人工智能部门)

AI总结 XMerge是一种无需任务标签或端到端微调的LLM深度压缩后处理方法,通过跨轴选择和局部边界重构实现高效压缩,在7种主干模型及多个基准上表现优异,仅需数万个请求即可收回构建成本。

Comments Preprint. Under review at a NeurIPS 2026 workshop. 21 pages total, 5 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01992 2026-09-03 cs.AI cs.CR cs.MA 新提交

ClaimReceipt: Verifying Evidence Sufficiency and Coverage in Agent Evaluations

ClaimReceipt:智能体评估中证据充分性与覆盖范围的验证

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI实验室)

AI总结 提出ClaimReceipt规范与验证器,可验证智能体评估中声明的证据充分性与覆盖范围,在历史记录和前瞻性实验中验证有效,开销极低但规范可读性待提升。

Comments Submitted to Who Verifies the Agents? Toward Reliable Agent Development (NeurIPS 2026 workshop). 8 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01852 2026-09-03 cs.AI cs.CL 新提交

The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents

记忆信任缺口:持久记忆智能体中依赖能力的故障

Jundong Hu, Shekar Ramachandran

机构 * PayPal AI(PayPal人工智能部门)

AI总结 该研究针对Qwen3等模型,发现持久记忆智能体存在依赖能力的记忆信任缺口,过时信息会被过度信任,且缓解措施需适配模型能力,在多模型和数据集上验证了该现象。

Comments Preprint. Under review at a NeurIPS 2026 workshop. 14 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02766 2026-09-03 cs.LG astro-ph.IM 新提交

Do Tabular Foundation Models Know Physics? Contamination, Units, and the Deterministic Limit

表格基础模型是否懂物理?污染、单位与确定性极限

Wassim Tenachi, Yashar Hezaveh, Laurence Perreault Levasseur, Pierre-Luc Bacon

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所)

AI总结 该研究探究表格基础模型(TFMs)是否掌握物理知识,通过在316个物理方程采样的数据集上对比4种TFMs与6种基准,发现TFMs性能更优,但先验无法表示无噪声机制与物理单位,尚不能作为物理模型使用。

Comments 5 pages (4 figures, 1 table). Submitted to the Representations for the Physical Sciences Workshop @ NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13361 2026-09-03 cs.CV cs.AI

VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs

VLMs有隧道视野:评估领先VLMs的非局部视觉推理能力

Shmuel Berman, Jia Deng

机构 * Princeton University(普林斯顿大学)

AI总结 本文评估了领先VLMs的非局部视觉推理能力,发现其在复杂视觉任务上表现不佳,缺乏人类核心视觉推理能力。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16691 2026-09-03 cs.CV

InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention

Qiang Xiang, Shuang Sun, Binglei Li, Dejia Song, Huaxia Li, Nemo Chen, Xu Tang, Yao Hu, Junping Zhang

Comments Accepted in NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏