arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

2025-12-03 至 2025-12-03 共收录 22
2512.03014 2025-12-03 cs.CV

Instant Video Models: Universal Adapters for Stabilizing Image-Based Networks

即时视频模型:用于稳定图像网络的通用适配器

Matthew Dutson, Nathan Labiosa, Yin Li, Mohit Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种通用的稳定性适配器,用于提升视频中图像网络的稳定性和鲁棒性,通过统一的损失函数和高效训练方法,在多个视觉任务中提升了预测质量与抗损坏能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02914 2025-12-03 cs.AI cs.CL cs.LG

Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning

马尔可夫得分:一种用于大语言模型推理中贝叶斯理性性的无监督度量标准

Zhonghao He, Tianyi Qiu, Hirokazu Shirado, Maarten Sap

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究提出马尔可夫得分,用于评估大语言模型推理中的贝叶斯理性性,通过检测信念更新的违反情况来衡量求真能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02228 2025-12-03 cs.AI cs.LG

STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls

STRIDE:一种选择AI模态的系统框架——代理AI、AI助手或LLM调用

Shubhi Asthana, Bing Zhang, Chad DeLuca, Ruchi Mahindru, Hima Patel

机构 * IBM Research – Almaden(IBM阿尔马登研究实验室) IBM Research – Yorktown(IBM约克镇研究实验室) IBM Research – India(IBM印度研究实验室)

AI总结 STRIDE提供了一种系统框架,帮助选择AI模态,通过评估任务动态性决定是否使用自主代理,提升效率并降低成本。

Comments 10 pages, 4 Figures, 5 Tables Paper presented at NeurIPS 2025 LAW workshop: Bridging Language, Agent, and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18659 2025-12-03 stat.ML cs.AI cs.LG stat.ME

Adaptive Prediction-Powered AutoEval with Reliability and Efficiency Guarantees

具有可靠性和效率保证的自适应预测-驱动AutoEval

Sangwoo Park, Matteo Zecchin, Osvaldo Simeone

机构 * Department of Engineering(工程系)

AI总结 本文提出R-AutoEval+框架,通过自适应构造模型评估变量,实现模型评估的可靠性保障和样本效率提升。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15450 2025-12-03 cs.CL

SkyLadder: Better and Faster Pretraining via Context Window Scheduling

SkyLadder: 通过上下文窗口调度实现更优更高效的预训练

Tongyao Zhu, Qian Liu, Haonan Wang, Shiqi Chen, Xiangming Gu, Tianyu Pang, Min-Yen Kan

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室) City University of Hong Kong(香港城市大学)

AI总结 SkyLadder通过上下文窗口调度策略,在保持基准性能的同时,提升了长上下文任务的表现,并加快了训练速度。

Comments Accepted to NeurIPS 2025. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02450 2025-12-03 cs.CV cs.AI

HouseLayout3D: A Benchmark and Training-Free Baseline for 3D Layout Estimation in the Wild

HouseLayout3D: 一个用于野外3D布局估计的基准和无需训练的基线

Valentin Bieri, Marie-Julie Rakotosaona, Keisuke Tateno, Francis Engelmann, Leonidas Guibas

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Stanford University(斯坦福大学)

AI总结 HouseLayout3D提出一个无需训练的基线,通过现实世界数据推动多楼层建筑的3D布局估计研究。

Comments NeurIPS 2025 (Datasets and Benchmarks Track) Project Page: https://houselayout3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02315 2025-12-03 q-bio.BM cs.LG

Few-shot Protein Fitness Prediction via In-context Learning and Test-time Training

少样本蛋白质适应性预测通过上下文学习和测试时训练

Felix Teufel, Aaron W. Kollasch, Yining Huang, Ole Winther, Kevin K. Yang, Pascal Notin, Debora S. Marks

机构 * Harvard Medical School(哈佛医学院) University of Copenhagen(哥本哈根大学) Novo Nordisk A/S(诺和诺德公司) Microsoft Research(微软研究院) Technical University of Denmark(丹麦技术大学)

AI总结 PRIMO通过上下文学习和测试时训练,在少样本条件下实现蛋白质适应性预测,优于零样本和全监督基线。

Comments AI for Science Workshop (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02260 2025-12-03 q-bio.QM stat.ML

EcoCast: A Spatio-Temporal Model for Continual Biodiversity and Climate Risk Forecasting

EcoCast:一种用于持续生物多样性和气候风险预测的空间时间模型

Hammed A. Akande, Abdulrauf A. Gidado

AI总结 EcoCast通过多源数据和序列Transformer模型,实现持续的生物多样性和气候风险预测,提升非洲生态保护策略的科学依据。

Comments 9 pages, 3 figures, 1 table. Accepted to the NeurIPS 2025 Workshop on Tackling Climate Change with Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02227 2025-12-03 cs.MA cs.AI cs.CE cs.LG

Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading

金融代理的协调框架:从算法交易到代理交易

Jifeng Li, Arnav Grover, Abraham Alpuerto, Yupeng Cao, Xiao-Yang Liu

机构 * SecureFinAI Lab, Columbia University(安全金融人工智能实验室,哥伦比亚大学) Purdue University(普渡大学) Rensselaer Polytechnic Institute(拉特格斯理工学院) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 本文提出了一种金融代理的协调框架,通过代理系统实现了股票和加密货币交易,展示了其在不同市场中的表现和优势。

Comments Accepted at the Workshop on Generative AI in Finance, 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02206 2025-12-03 cs.LG cs.SD

WhAM: Towards A Translative Model of Sperm Whale Vocalization

WhAM:迈向 sperm 尾声的翻译模型

Orr Paradise, Pranav Muralikrishnan, Liangyuan Chen, Hugo Flores García, Bryan Pardo, Roee Diamant, David F. Gruber, Shane Gero, Shafi Goldwasser

机构 * UC Berkeley(加州大学伯克利分校) Project CETI Northwestern University(西北大学) Haifa University(海法大学) City University of New York(纽约城市大学) Carleton University(卡尔顿大学)

AI总结 WhAM是一种基于transformer的模型,能够从音频提示生成高保真的抹香鲸咔嗒声,通过微调预训练的VampNet模型,实现了在节奏、社会单位和元音分类等任务上的优异表现。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02161 2025-12-03 cs.CV

FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges

FineGRAIN:通过视觉语言模型法官评估文本到图像模型的故障模式

Kevin David Hayes, Micah Goldblum, Vikash Sehwag, Gowthami Somepalli, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Columbia University(哥伦比亚大学) Sony AI(索尼人工智能)

AI总结 FineGRAIN通过视觉语言模型评估文本到图像模型的故障模式,揭示属性保真度和物体表示的系统性错误,强调了针对性基准测试对生成模型可靠性的重要性。

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22154 2025-12-03 cs.AI

WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios

WearVQA: 一个用于评估智能眼镜等可穿戴设备上多模型AI助手视觉问答能力的基准测试

Eun Chang, Zhuangqun Huang, Yiwei Liao, Sagar Ravi Bhavsar, Amogh Param, Tammy Stark, Adel Ahmadyan, Xiao Yang, Jiaqi Wang, Ahsan Abdullah, Giang Nguyen, Akil Iyer, David Hall, Elissa Li, Shane Moon, Nicolas Scheffer, Kirmani Ahmed, Babak Damavandi, Rakesh Wanga, Anuj Kumar, Rohit Patel, Xin Luna Dong

AI总结 WearVQA是一个评估可穿戴设备上多模型AI助手视觉问答能力的基准测试,通过真实场景下的图像-问题-答案三元组,评估其在复杂视觉输入和现实任务中的表现。

Comments 11 pages, 5 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09809 2025-12-03 cs.CV cs.AI cs.LG

Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models

测试时谱感知的潜在引导用于视觉-语言模型中的零样本泛化

Konstantinos M. Dafnis, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学)

AI总结 本文提出STP,一种轻量级的测试时适应框架,通过谱感知方法引导潜在表示,提升视觉-语言模型在零样本泛化中的性能,同时保持高效推理速度和低内存消耗。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20199 2025-12-03 cs.LG

Risk-Averse Constrained Reinforcement Learning with Optimized Certainty Equivalents

具有优化确定等价的风险厌恶约束强化学习

Jane H. Lee, Baturay Saglam, Spyridon Pougkakiotis, Amin Karbasi, Dionysis Kalogerias

机构 * Yale University(耶鲁大学) King’s College London(伦敦国王学院) Cisco Systems Inc.(思科系统公司)

AI总结 本文提出一种基于优化确定等价的风险厌恶约束强化学习框架,通过增强鲁棒性和算法收敛性,提升高风险环境下的决策可靠性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04699 2025-12-03 cs.LG eess.SP

CPEP: Contrastive Pose-EMG Pre-training Enhances Gesture Generalization on EMG Signals

CPEP:对比姿态-肌电预训练增强肌电信号上的手势泛化

Wenhui Cui, Christopher Sandino, Hadi Pouransari, Ran Liu, Juri Minxha, Ellen Zippi, Aman Verma, Anna Sedlackova, Erdrin Azemi, Behrooz Mahasseni

机构 * Apple(苹果公司) Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明希部门电子与计算机工程系,南加州大学)

AI总结 CPEP通过对比姿态和肌电表示提升手势分类性能,实现零样本学习和分布外泛化。

Comments Accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Foundation Models for the Brain and Body

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12792 2025-12-03 cs.LG cs.AI cs.CL stat.ML

Bridging Human and LLM Judgments: Understanding and Narrowing the Gap

弥合人类与大语言模型判断之间的鸿沟:理解和缩小差距

Felipe Maia Polo, Xinhe Wang, Mikhail Yurochkin, Gongjun Xu, Moulinath Banerjee, Yuekai Sun

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) Institute of Foundation Models, MBZUAI(基础模型研究院)

AI总结 Bridge通过统一统计框架弥合人类与LLM判断差距,改进评分并揭示系统性差异。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05332 2025-12-03 cs.CV cs.CL

Unleashing Hour-Scale Video Training for Long Video-Language Understanding

释放小时级视频训练以实现长视频-语言理解

Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum

AI总结 本文提出VideoMarathon数据集和Hour-LLaVA模型,通过小时级视频训练提升长视频-语言理解能力。

Comments NeurIPS 2025, Project page: https://videomarathon.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07561 2025-12-03 cs.CV

Alligat0R: Pre-Training Through Co-Visibility Segmentation for Relative Camera Pose Regression

Alligat0R:通过共视分割进行预训练以实现相对相机姿态回归

Thibaut Loiseau, Guillaume Bourmaud, Vincent Lepetit

机构 * LIGM, Ecole des Ponts, Univ. Gustave Eiffel, CNRS, France(LIGM,巴黎理工大学,埃菲尔大学,CNRS,法国) Univ. Bordeaux, CNRS, Bordeaux INP, IMS, UMR 5218, France(波尔多大学,CNRS,波尔多INP,IMS,UMR 5218,法国)

AI总结 Alligat0R通过共视分割预训练方法在相对相机姿态回归中优于CroCo

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01822 2025-12-03 cs.LG cs.AI

Projecting Assumptions: The Duality Between Sparse Autoencoders and Concept Geometry

投影假设:稀疏自编码器与概念几何的二元性

Sai Sumedh R. Hindupur, Ekdeep Singh Lubana, Thomas Fel, Demba Ba

机构 * School of Engineering and Applied Science, Harvard University(哈佛大学工程与应用科学学院) CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学人工智能物理项目) Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(NTT研究公司人工智能物理组) Kempner Institute, Harvard University(哈佛大学凯普纳研究所)

AI总结 本文探讨了稀疏自编码器与概念几何的二元性,揭示了SAE在不同架构下的局限性,并提出了一种新的SAE来解决概念恢复的问题。

Comments Published in NeurIPS 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06540 2025-12-03 cs.LG cs.AI stat.ML

Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families

Sloth: LLM技能的缩放定律用于跨家族预测多基准性能

Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Yuekai Sun, Mikhail Yurochkin

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI实验室,IBM研究) Computer Science and Artificial Intelligence Laboratory, MIT(MIT计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

AI总结 Sloth提出一种基于低维潜在技能的LLM缩放定律,通过跨基准相关性提升预测准确性,减少多家族训练需求。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01784 2025-12-03 cs.AI cs.CR

Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models

噪声注入揭示了“沙袋”语言模型的隐藏能力

Cameron Tice, Philipp Alexander Kreer, Nathan Helm-Burger, Prithviraj Singh Shahani, Fedor Ryzhenkov, Fabien Roger, Clement Neo, Jacob Haimes, Felix Hofstätter, Teun van der Weij

机构 * Geodesic Research Technical University of Munich(慕尼黑技术大学) Tufts University(塔夫茨大学) SecureBio Apart Research Anthropic Apollo Research

AI总结 通过噪声注入揭示沙袋语言模型的隐藏能力,提供了一种检测和评估前沿AI系统有效性的实用工具。

Comments Published at NeurIPS 2025, code available at https://github.com/camtice/SandbagDetect. Preliminary work presented at SATA and SoLaR (NeurIPS 2024 workshops)

详情

展开后加载摘要…

URL PDF HTML 收藏