arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-02-10 至 2026-02-10 共收录 8
2602.05842 2026-02-10 cs.CL

Reinforcement World Model Learning for LLM-based Agents

基于强化学习的世界模型学习用于基于大语言模型的智能体

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath, Nikhil Singh, Jiangfeng Gao, Zhou Yu

机构 * Columbia University, New York(哥伦比亚大学) Microsoft Research, Redmond(微软研究院) Dartmouth College, Hanover(达特茅斯学院)

AI总结 本文提出了一种基于强化学习的世界模型学习方法,用于提升基于大语言模型的智能体在环境动态适应和预测方面的性能。

Comments fixed Nikhil Singh's affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04915 2026-02-10 cs.LG cs.AI

SLAY: Geometry-Aware Spherical Linearized Attention with Yat-Kernel

SLAY:基于Yat-kernel的几何感知球面线性化注意力

Jose Miguel Luna, Taha Bouhsine, Krzysztof Choromanski

机构 * Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 SLAY通过几何感知的球面线性化注意力机制,实现了接近softmax注意力的性能,同时保持线性时间复杂度。

Comments ICML 2026, 8 pages main body, 27 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13240 2026-02-10 cs.LG

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13681 2026-02-10 stat.ME cs.LG econ.EM stat.ML

Estimating the Value of Evidence-Based Decision Making

估计基于证据的决策制定的价值

Alberto Abadie, Anish Agarwal, Guido Imbens, Siwei Jia, James McQueen, Serguei Stepaniants, Santiago Torres

机构 * Department of Economics, MIT(MIT经济学系) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系) Graduate School of Business, Stanford(斯坦福大学商学院)

AI总结 本文提出一个实证框架,用于估算基于证据的决策制定的价值,并评估统计精度和项目构想的回报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07787 2026-02-10 cs.AI

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

多智能体是否梦想着电子屏幕?通过任务分解在AndroidWorld上实现完美准确率

Pierre-Louis Favreau, Jean-Pierre Lo, Clement Guiguet, Charles Simon-Meunier, Nicolas Dehandschoewercker, Allen G. Roush, Judah Goldfeder, Ravid Shwartz-Ziv

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

AI总结 Minitap通过任务分解和多智能体架构在AndroidWorld上实现100%准确率,超越人类表现,解决单智能体架构的多个失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07706 2026-02-10 cs.LG

Dense Feature Learning via Linear Structure Preservation in Medical Data

通过线性结构保持实现密集特征学习:医学数据

Yuanyun Zhang, Mingxuan Zhang, Siyuan Li, Zihan Wang, Haoran Chen, Wenbo Zhou, Shi Li

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

AI总结 本文提出密集特征学习方法,通过线性结构保持提升医学数据表示的稳定性与可解释性,实现更优的下游性能。

Comments ICLR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05553 2026-02-10 cs.LG

Federated Hierarchical Reinforcement Learning for Adaptive Traffic Signal Control

联邦分层强化学习用于自适应交通信号控制

Yongjie Fu, Lingyun Zhong, Zifan Li, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Center for Smart Cities, Data Science Institute, Columbia University(哥伦比亚大学智能城市中心、数据科学研究所) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)

AI总结 本文提出分层联邦强化学习方法,用于解决大规模异质交通信号控制中的协调与可扩展性问题,通过动态分组提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12136 2026-02-10 cs.LG stat.ML

Provable Domain Adaptation for Offline Reinforcement Learning with Limited Samples

可证明的有限样本离线强化学习领域适应

Weiqin Chen, Xinjie Zhang, Sandipan Mishra, Santiago Paternain

机构 * Rensselaer Polytechnic Institute(新泽西理工学院) Columbia University(哥伦比亚大学)

AI总结 本文提出首个可证明的有限样本离线强化学习领域适应框架,通过理论分析和实验验证,探讨权重分配对性能的影响,并提供收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏