arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-06 至 2026-03-06 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2510.00177 2026-03-06 cs.CL cs.AI 81%

PrefDisco: Benchmarking Proactive Personalized Reasoning

PrefDisco:主动个性化推理的基准测试

Shuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon Shaolei Du, Pang Wei Koh, Maryam Fazel, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能联盟)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。

Comments 65 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05040 2026-03-06 cs.AI 79%

Enhancing Zero-shot Commonsense Reasoning by Integrating Visual Knowledge via Machine Imagination

通过机器想象力整合视觉知识以增强零样本常识推理

Hyuntae Park, Yeachan Kim, SangKeun Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Imagine框架,通过整合视觉知识提升零样本常识推理性能,有效缓解人类报告偏见,增强模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04616 2026-03-06 physics.ed-ph 78%

Chatbot Conversations in Physics Education: Using Artificial Intelligence to Analyze Student Reasoning through Computational Grounded Theory

物理教育中的聊天机器人对话:利用人工智能分析学生推理过程的计算 grounded 理论

Atharva Dange, Ramon E. Lopez

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究利用计算 grounded 理论分析聊天机器人对话数据,揭示学生在物理学习中的常见误解及思维模式,为开发更智能的教育工具提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05218 2026-03-06 cs.AI cs.LG 73%

KARL: Knowledge Agents via Reinforcement Learning

通过强化学习的知识代理:KARL

Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott, Jacob Portes, Abhay Gupta, Pallavi Koppol, Ashutosh Baheti, Sean Kulinski, Ivan Zhou, Irene Dea, Krista Opsahl-Ong, Simon Favreau-Lessard, Sean Owen, Jose Javier Gonzalez Ortiz, Arnav Singhvi, Xabi Andrade, Cindy Wang, Kartik Sreenivasan, Sam Havens, Jialu Liu, Peyton DeNiro, Wen Sun, Michael Bendersky, Jonathan Frankle

机构 * Databricks AI Research(Databricks人工智能研究)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 KARL通过强化学习训练企业搜索代理,结合多任务学习和定制合成数据,实现高效且高性能的知识代理,在多个复杂任务中表现优异。

Comments 77 pages, 43 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04763 2026-03-06 cs.CV cs.AI cs.LG 73%

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

评估GPT-5作为多模态临床推理者的有效性:领域评论

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03160 2026-03-06 cs.CV cs.AI 70%

SpineBench: A Clinically Salient, Level-Aware Benchmark Powered by the SpineMed-450k Corpus

SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动

Ming Zhao, Wenhui Dong, Yang Zhang, Xiang Zheng, Zhonghao Zhang, Zian Zhou, Yunzhi Guan, Liukun Xu, Wei Peng, Zhaoyang Gong, Zhicheng Zhang, Dachuan Li, Xiaosheng Ma, Yuli Ma, Jianing Ni, Changjiang Jiang, Lixia Tian, Qixin Chen, Kaishun Xia, Pingping Liu, Tongshun Zhang, Zhiqiang Liu, Zhongyan Bi, Chenyang Si, Tiansheng Sun, Caifeng Shan

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04729 2026-03-06 cs.SE 67%

Behaviour Driven Development Scenario Generation with Large Language Models

基于大语言模型的行为驱动开发场景生成

Amila Rathnayake, Mojtaba Shahin, Golnoush Abaei

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了三种大语言模型在BDD场景生成中的表现,发现Claude 3在人类和模型评估中表现最佳,提示技术和输入质量对生成质量有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04476 2026-03-06 cs.SE cs.PL 67%

iScript: A Domain-Adapted Large Language Model and Benchmark for Physical Design Tcl Script Generation

iScript: 一种领域适应的大型语言模型和基准,用于物理设计 Tcl 脚本生成

Ning Xu, Zhaoyang Zhang, Senlin Shu, Lei Qi, Jiaqi Lv, Wensuo Wang, Tianhao Zhao, Chao Zhang, Zhaoliang Yang, Xiangyu Li, Zhaorui Su, Jingshan Li, Xin Geng

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 iScript 是一种专门用于物理设计 Tcl 脚本生成的领域适应大语言模型,通过多阶段数据合成和两阶段训练策略提升脚本生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04162 2026-03-06 cs.CL cs.AI 62%

Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model

Bielik-Q2-Sharp:极端2位量化方法在波兰11B语言模型上的比较研究

Jakub Prejzner

机构 * BitSharp

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Bielik-Q2-Sharp通过比较六种极端2位量化方法,评估其在波兰11B语言模型上的性能,发现QuIP# E8P12在高阶推理保留方面表现更优,同时在规模和效率上具有竞争力。

Comments 17 pages, 13 tables. All models and Hessians available at https://huggingface.co/Jakubrd4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01209 2026-03-06 cs.AI cs.LG 62%

Agents Learn Their Runtime: Interpreter Persistence as Training-Time Semantics

智能体学习其运行时:解释器持久性作为训练时语义

Victor May, Aaditya Salgarkar, Yishan Wang, Diganta Misra, Huu Nguyen

机构 * Ontocord Carnegie Mellon University(卡内基梅隆大学) MPI-IS Tübingen(图宾根MPI研究所) Tübingen AI Center(图宾根人工智能中心) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨解释器持久性对智能体学习的影响,发现其影响解决方案达成方式而非能否达成,且训练与运行时对齐可提升效率。

Comments Code: https://github.com/mrcabbage972/agents-learn-runtime

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 62%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20321 2026-03-06 cs.CL cs.AI eess.AS 62%

Conversational Speech Reveals Structural Robustness Failures in SpeechLLM Backbones

会话语音揭示了SpeechLLM骨干结构鲁棒性失效

Maria Teleki, Sai Janjur, Haoran Liu, Oliver Grabner, Ketan Verma, Thomas Docog, Xiangjue Dong, Lingfeng Shi, Cong Wang, Stephanie Birkelbach, Jason Kim, Yin Zhang, Éva Székely, James Caverlee

机构 * Texas A&M University(德克萨斯大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 会话语音揭示SpeechLLM骨干结构鲁棒性失效,模型在处理不流畅内容时存在结构修复与语义抽象的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18088 2026-03-06 cs.CL cs.LG 62%

How Quantization Shapes Bias in Large Language Models

量化如何塑造大型语言模型中的偏见

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨量化对大型语言模型偏见的影响,发现量化在减少毒性的同时可能增加刻板印象和不公平性,强调了在应用量化时需平衡效率与伦理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04403 2026-03-06 cs.IR cs.AI cs.CL 62%

FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents

FinRetrieval:通过AI代理进行金融数据检索的基准测试

Eric Y. Kim, Jie Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FinRetrieval通过AI代理进行金融数据检索的基准测试,揭示了工具可用性对性能的主导作用及不同代理在推理模式和基础能力上的差异。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05129 2026-03-06 cs.AI cs.MA 57%

MedCoRAG: Interpretable Hepatology Diagnosis via Hybrid Evidence Retrieval and Multispecialty Consensus

MedCoRAG:通过混合证据检索和多专科共识进行可解释的肝病诊断

Zheng Li, Jiayi Xu, Zhikai Hu, Hechang Chen, Lele Cong, Yunyun Wang, Shuchao Pang

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学信息科学与工程学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Neurology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院神经内科) Department of Anesthesiology, China-Japan Union Hospital of Jilin University(吉林大学中日联谊医院麻醉科) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MedCoRAG通过混合证据检索和多专科共识,提升肝病诊断的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL 57%

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI 57%

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 57%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV 50%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04598 2026-03-06 cs.CV 50%

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

专题命中 推理评测 :reasoning(abstract)

AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。

Comments Accepted for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2603.05275 2026-03-06 cs.MM cs.CL cs.SD 79%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL 79%

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04921 2026-03-06 cs.CL 77%

AILS-NTUA at SemEval-2026 Task 10: Agentic LLMs for Psycholinguistic Marker Extraction and Conspiracy Endorsement Detection

AILS-NTUA 在 SemEval-2026 任务 10: 用于心理语言学标记提取和阴谋支持检测的代理 LLM

Panagiotis Alexios Spanakis, Maria Lymperaiou, Giorgos Filandrianos, Athanasios Voulodimos, Giorgos Stamou

机构 * School of Electrical and Computer Engineering, AILS Laboratory(电气与计算机工程学院,AILS实验室) National Technical University of Athens(希腊雅典国家技术大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 AILS-NTUA 提出了一种代理 LLM 管道,通过动态判别链式思维和对抗性架构,在 SemEval-2026 任务 10 中实现了高精度的心理语言学标记提取和阴谋支持检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04534 2026-03-06 cs.LG cs.AI cs.CY 62%

Invariant Causal Routing for Governing Social Norms in Online Market Economies

不变因果路由:用于在线市场经济中规范治理

Xiangning Yu, Qirui Mi, Xiao Xue, Haoxuan Li, Yiwei Shi, Xiaowei Liu, Mengyue Yang

机构 * Tianjin University(天津大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) University of Bristol(布里斯托大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出不变因果路由(ICR)框架,通过因果推理和不变因果发现,实现在线市场经济中稳定社会规范的治理,提升政策的可解释性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04464 2026-03-06 cs.LG cs.AI 62%

Understanding the Dynamics of Demonstration Conflict in In-Context Learning

理解上下文学习中演示冲突的动力学

Difan Jiao, Di Wang, Lijie Hu

机构 * University of Toronto(多伦多大学) King Abdullah University of Science(卡布斯国王科学大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了上下文学习中演示冲突的处理机制,发现模型在冲突证据下表现出两阶段计算结构,通过注意力头分析揭示了模型对腐败证据的敏感性,并验证了针对性消融对性能提升的显著影响。

Comments 19 pages,12 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08966 2026-03-06 cs.AI cs.CL 62%

Beyond Prefixes: Graph-as-Memory Cross-Attention for Knowledge Graph Completion with Large Language Models

超越前缀:基于图记忆的交叉注意力用于大型语言模型的知识图谱补全

Ruitong Liu, Boxu Lin, Peize Li, Siyuan Li, Yunjia Wu, Te Sun, Chaohan Wu

机构 * Peking University(北京大学) Dalian University of Technology(大连理工大学) King’s College London(伦敦国王学院) Peng Cheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出图记忆调优方法,通过深度交叉注意力机制提升大型语言模型在知识图谱补全任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04406 2026-03-06 cs.CL cs.AI 62%

CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models

CTRL-RAG:基于对比似然奖励的强化学习用于上下文忠实的RAG模型

Zhehao Tan, Yihan Jiao, Dan Yang, Junjie Wang, Duolin Sun, Jie Feng, Xidong Wang, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CTRL-RAG通过对比似然奖励机制提升RAG模型的上下文忠实性,结合内部与外部奖励框架,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05225 2026-03-06 cs.AI cs.AR 57%

AI+HW 2035: Shaping the Next Decade

AI+HW 2035:塑造下一十年

Deming Chen, Jason Cong, Azalia Mirhoseini, Christos Kozyrakis, Subhasish Mitra, Jinjun Xiong, Cliff Young, Anima Anandkumar, Michael Littman, Aron Kirschen, Sophia Shao, Serge Leef, Naresh Shanbhag, Dejan Milojicic, Michael Schulte, Gert Cauwenberghs, Jerry M. Chow, Tri Dao, Kailash Gopalakrishnan, Richard Ho, Hoshik Kim, Kunle Olukotun, David Z. Pan, Mark Ren, Dan Roth, Aarti Singh, Yizhou Sun, Yusu Wang, Yann LeCun, Ruchir Puri

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一项为期十年的AI+HW协同设计路线图,旨在通过提升能效、系统集成和跨层优化,实现AI训练和推理的1000倍效率提升,并推动能源感知的自优化系统发展。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18929 2026-03-06 cs.IR cs.AI 57%

Give Users the Wheel: Towards Promptable Recommendation Paradigm

让用户掌控方向:迈向可提示的推荐范式

Fuyuan Lyu, Chenglin Luo, Qiyuan Zhang, Yupeng Hou, Haolun Wu, Xing Tang, Xue Liu, Jin L. C. Guo, Xiuqiang He

机构 * McGill \& Mila - Quebec AI Institute Montreal Canada Shenzhen Technological University Shenzhen China University of California San Diego San Diego US McGill University Montreal Canada McGill \& Mila - Quebec AI Institute Shenzhen Technological University University of California San Diego McGill University

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DPR模型,通过解耦的可提示顺序推荐框架,使传统推荐模型能够动态利用自然语言提示优化检索过程,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04416 2026-03-06 cs.CL 57%

Optimizing What We Trust: Reliability-Guided QUBO Selection of Multi-Agent Weak Framing Signals for Arabic Sentiment Prediction

优化我们信任的内容:基于可靠性引导的多智能体弱标注信号QUBO选择用于阿拉伯语情感预测

Rabab Alkhalifa

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于可靠性的弱监督框架,通过QUBO选择优化多智能体弱标注信号,提升阿拉伯语情感预测的可靠性与结构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏