arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-02-04 至 2026-02-04 共收录 13
2602.03769 2026-02-04 cs.LG

Reasoning with Latent Tokens in Diffusion Language Models

在扩散语言模型中使用潜在令牌进行推理

Andre He, Sean Welleck, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出通过引入潜在令牌提升扩散语言模型在需要全局一致性和前瞻性的推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18795 2026-02-04 cs.LG cs.AI cs.CL

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

重用FLOPs:通过条件化非常离策略前缀来扩展RL在困难问题上的应用

Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

机构 * Meta Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学)

AI总结 通过条件化离策略前缀提升RL在困难问题上的学习效率,实现更快的训练奖励和更高的最终奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08951 2026-02-04 cs.CY cs.AI cs.CL

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

PluriHarms:对AI危害全谱人类判断的基准测试

Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine

机构 * UC Berkeley(伯克利大学) Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能研究院) New York University(纽约大学)

AI总结 PluriHarms通过系统研究人类对AI危害的判断,旨在推动更安全的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13930 2026-02-04 cs.LG

ME-IGM: Individual-Global-Max in Maximum Entropy Multi-Agent Reinforcement Learning

ME-IGM:最大熵多智能体强化学习中的个体-全局-最大

Wen-Tse Chen, Yuxuan Li, Shiyu Huang, Jiayu Chen, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) XPeng Inc.(XPeng公司) The University of Hong Kong(香港大学) INFIFORCE Intelligent Tech. Co., Ltd.(INFIFORCE智能科技有限公司)

AI总结 ME-IGM是一种结合最大熵探索与IGM条件的新型多智能体强化学习算法,通过解决局部策略与联合策略不一致问题,提升探索效率和性能。

Comments Published in the Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25 - 29, 2026, IFAAMAS, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03183 2026-02-04 cs.CL cs.AI

Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch

Privasis:从零开始合成最大的“公共”私有数据集

Hyunwoo Kim, Niloofar Mireshghallah, Michael Duan, Rui Xin, Shuyue Stella Li, Jaehun Jung, David Acuna, Qi Pang, Hanshen Xiao, G. Edward Suh, Sewoong Oh, Yulia Tsvetkov, Pang Wei Koh, Yejin Choi

机构 * NVIDIA CMU(卡内基梅隆大学) USC(南加州大学)

AI总结 Privasis是首个从零开始构建的百万级合成数据集,用于提升隐私敏感领域研究的规模和效率,其模型在隐私净化任务中表现优异。

Comments For code and data, see https://privasis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03023 2026-02-04 cs.SD cs.LG

Rethinking Music Captioning with Music Metadata LLMs

重新思考基于音乐元数据的音乐描述生成

Irmak Bukey, Zhepei Wang, Chris Donahue, Nicholas J. Bryan

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究)

AI总结 本文提出基于元数据的音乐描述生成方法,通过训练元数据预测模型和预训练LLMs,实现更灵活的描述生成和元数据填补。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02970 2026-02-04 cs.LG

Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL

Co2PO:多智能体强化学习中的协调约束策略优化

Shrenik Patel, Christine Truong

机构 * Rutgers University, New Brunswick, NJ(罗杰斯大学,新不伦瑞克,新泽西) Carnegie Mellon University, Pittsburgh, PA(卡内基梅隆大学,匹兹堡,宾夕法尼亚)

AI总结 Co2PO通过引入共享黑板架构和风险预测机制,实现多智能体强化学习中的协调安全优化,提升探索效率并减少保守性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02828 2026-02-04 cs.LG

A Single Revision Step Improves Token-Efficient LLM Reasoning

一步修订提升令牌高效大语言模型推理

Yingchuan Zhang, Terry Ma, Wenxuan Zhong, Ping Ma

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Georgia(佐治亚大学)

AI总结 PACER通过轨迹间互相审查提升令牌高效大语言模型推理准确性,显著优于传统投票方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02813 2026-02-04 stat.AP cs.LG stat.CO stat.ME

Downscaling land surface temperature data using edge detection and block-diagonal Gaussian process regression

利用边缘检测和块对角高斯过程回归下推土地表面温度数据

Sanjit Dandapanthula, Margaret Johnson, Madeleine Pascolini-Campbell, Glynn Hulley, Mikael Kuusela

机构 * Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出利用边缘检测和块对角高斯过程回归方法,从ECOSTRESS数据中高分辨率估计土地表面温度,以提高农业应用中的蒸散发估算精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02790 2026-02-04 cs.HC cs.AI cs.RO

Simulating Human Audiovisual Search Behavior

模拟人类视听搜索行为

Hyunsung Cho, Xuejing Luo, Byungjoo Lee, David Lindlbauer, Antti Oulasvirta

机构 * Aalto University Helsinki Finland Carnegie Mellon University Pittsburgh PA USA Aalto University \& ELLIS Institute Helsinki Finland Yonsei University Seoul Republic of Korea Aalto University Carnegie Mellon University Aalto University \& ELLIS Institute Yonsei University

AI总结 Sensonaut模型通过资源理性决策模拟人类视听搜索行为,优化搜索效率与认知负荷。

Comments 17 pages, 10 figures, CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02722 2026-02-04 cs.LG cs.CV cs.RO

Hierarchical Entity-centric Reinforcement Learning with Factored Subgoal Diffusion

分层实体导向强化学习与分因子子目标扩散

Dan Haramati, Carl Qi, Tal Daniel, Amy Zhang, Aviv Tamar, George Konidaris

机构 * Brown University(布朗大学) UT Austin(得克萨斯大学) Carnegie Mellon University(卡内基梅隆大学) Technion(技术学院)

AI总结 本文提出分层实体导向强化学习方法,通过分因子子目标生成模型提升多实体领域中长周期任务的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02581 2026-02-04 cs.LG cs.AI

QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals

QuantLRM:通过微调信号对大推理模型进行量化

Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

AI总结 QuantLRM通过微调信号对大推理模型进行量化,通过拟合二次函数保护两端,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏