arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19063 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19063 篇

2512.10359 2026-06-30 cs.CV cs.AI 77%

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28294 2026-06-29 cs.LG cs.MA 新提交 77%

Democratic ICAI: Debating Our Way to Steering Principles from Preferences

民主ICAI:通过辩论从偏好中推导指导原则

Kevin Kingslin, Anish Natekar, Ashutosh Ranjan, Vivek Srivastava, Savita Bhat, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 提出Democratic ICAI方法,通过结构化角色辩论收集多元理由,从偏好中提取更全面的指导原则,提升偏好预测准确性。

Comments Accepeted to the ICLR 2026 HCAIR Workshop, 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26794 2026-06-26 cs.CV cs.AI 新提交 77%

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 77%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23716 2026-06-24 cs.CY cs.AI 新提交 77%

Legal Reasoning Is Not Lawyering: Rethinking Legal Benchmarks for Pro Se Access to Justice

法律推理不是律师工作:重新思考面向自助诉讼的司法基准

Andrew Lou, David Shin

机构 * Yale Law School, USA(耶鲁法学院,美国)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出当前法律AI基准仅评估专家预处理后的输入,忽略了自助诉讼者提供的杂乱、有误的提示,导致模型性能高估;通过实验展示上下界差距,呼吁建立直接衡量鲁棒性的基准。

Comments Both authors contributed equally. Accepted to the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23238 2026-06-24 cs.AI 新提交 77%

HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs

HOLMES: 评估大语言模型中的高阶逻辑推理

Yucheng Wu, Jundong Xu, Mingzhen Ju, Yue Yu, Chenpeng Wang, Haoxuan Li, Liangming Pan

机构 * State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) YiXin-AILab, YIXIN(YiXin-AILab,YIXIN)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出HOLMES基准,基于高阶逻辑评估LLM在规则、谓词和约束上的推理能力,发现当前模型平均准确率仅50.64%,揭示高阶符号推理是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06395 2026-06-24 cs.CL 版本更新 77%

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages

AfriqueLLM: 数据混合与模型架构如何影响非洲语言的持续预训练

Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(魁北克AI研究所) LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) Microsoft AI for Good Research Lab(微软AI for Good研究实验室)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过持续预训练26B tokens,在20种非洲语言上构建了AfriqueLLM模型套件,系统研究了数据组成和模型架构对下游性能的影响,发现数据组成是主要驱动因素,且架构选择比模型规模更重要。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交 77%

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21734 2026-06-23 cs.CV cs.AI 新提交 77%

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

HPP:通过解耦感知与推理的分层程序化探测用于长视频理解

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) AMD(AMD公司) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。

Comments Project page: https://awaisrauf.com/HPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21557 2026-06-23 cs.CL 新提交 77%

PeerMathDial: A Middle School Dialogue Dataset for Student Collaborative Math Problem Solving

PeerMathDial:面向中学生协作数学问题解决的对话数据集

Murong Yue, Desmond Alexander Mcglone, Emily Slutz, Wenhan Lyu, Yixuan Zhang, Jennifer Suh, Ziyu Yao

机构 * George Mason University(乔治梅森大学) William & Mary(威廉与玛丽学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 为解决现有教育对话数据集缺乏同伴互动的问题,构建了首个来自真实中学数学课堂的同伴协作问题解决对话数据集PeerMathDial,包含55段对话、6406轮次,并基于LLM构建对话行为分类体系,用于分析对话演化、学生特质与行为关联及LLM模拟能力。

Comments 17 pages. Project website (dataset and source code): https://ziyu-yao-nlp-lab.github.io/MathVC-NSF.github.io/. Accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA) co-located at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21169 2026-06-23 cs.AI 新提交 77%

Trip+: Benchmarking Agents in Personalized Interactive Travel Planning

Trip+: 个性化交互式旅行规划中的智能体基准测试

Junle Chen, Wei Chen, Yehong Xu, Zhengjun Huang, Yuqian Wu, Zhoujin Tian, Kai Wang, Lei Wang, Xiaofang Zhou

机构 * HKUST(香港科技大学) Tencent Hy(腾讯Hy) HKUST(GZ)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出Trip+基准,通过多轮交互和分钟级行程生成与修订,评估智能体在个性化旅行规划中的可行性、偏好匹配及主观体验(如疲劳度),发现现有模型倾向于技术可行但耗时的行程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04619 2026-06-23 cs.AI cs.LO 版本更新 77%

A Four-Valued Normative Intermediate Representation for ASP-Oriented Compliance Reasoning

基于ASP的合规推理的规范性中间表示

Huanyu Yang, Yangfan Wu, Jianmin Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出MONIR,一种用于ASP合规推理的模态化输出规范性中间表示,通过分阶段操作语义和可执行编译,结合LLM辅助流程应用于中国ADAS法规,并评估提取质量与模块化增量求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25702 2026-06-19 cs.CL 版本更新 77%

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

S2D2:通过免训练自我推测实现扩散LLM的快速解码

Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Iowa State University(爱荷华州立大学) Core AI, IBM(IBM核心AI)

专题命中 推理与问题求解 :LLM(title_cn);language model(abstract);分类 cs.CL

AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。

Comments Code is available at https://github.com/phymhan/S2D2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18850 2026-06-18 cs.CL cs.IR 新提交 77%

ScholarSum: Student-Teacher Abstractive Summarization via Knowledge Graph Reasoning and Reflective Refinement

ScholarSum:基于知识图谱推理与反思性精炼的师生式抽象摘要生成

Bohou Zhang, Xiaoyu Tao, Mingyue Cheng, Huijie Liu, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ScholarSum框架,通过构建层次知识图谱引导学生生成初稿,并利用教师式审阅者迭代检查与修正,实现科学文献摘要的流畅性与事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16562 2026-06-16 cs.LG 新提交 77%

MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

MIRAGE: 审计前沿大语言模型在推理、智能体与时间耦合条件下的反穆斯林偏见

Noor Islam S. Mohammad, Tamim Sheikh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MIRAGE基准,包含1200个提示,覆盖直接完成、思维链推理和模拟智能体决策三种部署场景,发现思维链放大偏见、智能体决策存在不对称性、偏见与检索新闻时间耦合,现有缓解措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14961 2026-06-16 cs.CL 新提交 77%

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

CoRA: 面向可靠思维链推理的置信度-理由对齐

Juming Xiong, Weixin Liu, Kevin Guo, Congning Ni, Junchao Zhu, Chongyu Qu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL

AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24102 2026-06-15 cs.CL 版本更新 77%

Pragmatic Inference for Moral Reasoning Acquisition: Generalization via Metapragmatic Links

道德推理习得的语用推理:通过元语用链接实现泛化

Guangliang Liu, Xi Chen, Bocheng Chen, Han Zi, Xitong Zhang, Kristen Johnson

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Nanyang Technological University(南洋理工大学) University of Mississippi(密苏里大学) Northeastern University(东北大学) Qualcomm(高通公司) Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型在道德推理中泛化能力不足的问题,提出基于元语用链接和道德基础理论的语用推理方法,使模型获取道德推理目标与社会变量间的元语用链接,在三个任务上验证了其适应性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12828 2026-06-12 cs.AI 新提交 77%

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号

Rasul Khanbayov, Hasan Kurban

机构 * College of Science and Engineering(科学与工程学院) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Doha, Qatar(卡塔尔多哈)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11724 2026-06-11 cs.AI 新提交 77%

Mind the Perspective: Let's Reason Recursively for Theory of Mind

注意视角:递归推理实现心智理论

Chao Lei, Guang Hu, Meng Yang, Yanbei Jiang, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院) SensiLab, Monash University, Australia(蒙纳士大学SensiLab)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出RecToM框架,通过递归视角构建建模嵌套信念,将高阶信念问题转化为实际世界问题,在多个ToM基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11195 2026-06-11 cs.CY cs.AI cs.HC 新提交 77%

From Consumption to Reflection: Designing Human-AI Relations for Stable Reasoning

从消费到反思:为稳定推理设计人-人工智能关系

Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke, Martin McKee

机构 * Faculty of Medicine, Lund University(吕勒欧大学医学院) Department of Economics, Lund University School of Economics and Management(吕勒欧大学经济学与管理学院经济系) Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出关系反思智能(RRI),一种推理时治理层,通过可审计的推理循环实现反思,将人机交互转变为联合推理系统,以补偿双方局限并实现稳定推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11164 2026-06-10 cs.AI 新提交 77%

ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

ReasonAlloc: 推理模型的分层解码时KV缓存预算分配

Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang, Mengzhe Ruan, Hanxu Hou, Peisong Wang, Linqi Song, Shuang Qiu

机构 * Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Shenzhen University of Advanced Technology(深圳理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长链式推理中KV缓存快速增长导致的推理瓶颈,提出ReasonAlloc框架,通过离线层预分配和在线头重分配的分层预算分配策略,在不增加训练开销下显著提升小预算下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10316 2026-06-10 cs.CL 新提交 77%

TabClaw: An Interactive and Self-Evolving Agent for Spreadsheet Manipulation and Table Reasoning

TabClaw: 一个用于电子表格操作和表格推理的交互式自进化智能体

Mingyue Cheng, Shuo Yu, Daoyu Wang, Qingchuan Li, Xiaoyu Tao, Qingyang Mao, Yitong Zhou, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TabClaw,一个开源交互式AI智能体,通过可编辑执行计划、流式ReAct循环、并行多表推理和用户记忆提取,提升电子表格操作和表格推理的透明性与个性化。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09556 2026-06-09 cs.AI 新提交 77%

AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation

AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究

Yinan Wang

机构 * Noah AI Research(Noah AI研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 通过分层消融实验,发现药物资产估值中AI科学家的决策上限由专有证据集决定,而非仅依赖推理框架;加入专有数据后决策质量显著提升。

Comments Preprint; 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07538 2026-06-09 cs.IR cs.AI 新提交 77%

Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents

面向遥感智能体的双向语义互补工具检索

Zeyuan Wang, Dongyang Hou, Cheng Yang, Xuezhi Cui, Linrui Xu, Bo Yu, Gaozhi Zhou, Ziyu Li, Liangtian Liu, Kai Ouyang, Wang Guo, Lili Zhu, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Mechanical and Electrical Engineering, Central South University(机械与电子工程学院,中南大学) Hunan Key Laboratory of Land Resources Evaluation and Utilization, Hunan Provincial Institute of Land and Resources Planning(湖南省国土资源评价与利用重点实验室,湖南省国土资源规划院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对遥感智能体工具检索中查询与文档语义不对称问题,提出双向语义互补方法:通过规划增强查询机制补充功能语义,利用动态工具依赖图注入上下文语义,显著提升复杂遥感任务工具检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26253 2026-06-09 cs.CL 版本更新 77%

Pragmatic Theories Enhance Understanding of Implied Meanings in LLMs

语用理论增强对LLM中隐含意义的理解

Takuma Sato, Seiya Kawano, Koichiro Yoshino

机构 * Nara Institute of Science and Technology(奈良科学技術大學) RIKEN(理化学研究所) Guardian Robot Project(守護機器人專案) Kyoto Institute of Technology(京都科技大學) Institute of Science Tokyo(東京科學研究所)

专题命中 推理与问题求解 :LLM(title_cn);language model(abstract);分类 cs.CL

AI总结 本研究提出以语用理论(如Grice语用学和关联理论)作为提示,引导语言模型逐步推理,在隐含意义理解任务上相比0-shot思维链提升高达9.6%的得分。

Comments Correction of minor typographical errors in the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07462 2026-06-08 cs.AI 新提交 77%

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

像真正的研究者一样行动:一套评估前沿LLM和研究生命周期中智能体框架的基准测试套件

Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :LLM(title_cn);foundation model(abstract);分类 cs.AI

AI总结 提出AARR基准系列,通过AARRI-Bench评估智能体在细粒度研究场景中模拟人类研究者的专业性、全面性和细微推理能力,发现最佳配置成功率仅68.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06842 2026-06-08 cs.CL 新提交 77%

CRAFT: A Unified Counterfactual Reasoning Framework for Tabular Question Answering and Fact Verification

CRAFT:面向表格问答与事实验证的统一反事实推理框架

Chenshuo Pan, Yu Zhao, Jie Zhang, Changzai Pan, Zhenhe Wu, Jiayi Liang, Yujie Mao, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Xingchen AGI Lab,China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(兴晨AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CRAFT统一反事实推理框架,将表格问答和事实验证转化为双向验证过程,通过构建声明及其反事实变体并加权整合证据,显著提升复杂表格推理性能。

Comments 24pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02748 2026-06-08 cs.NI cs.LG 版本更新 77%

Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning

面向6G的智能体世界建模:近实时生成式状态空间推理

Farhad Rezazadeh, Amir Ashtari Gargari, Hatim Chergui, Sandra Lagen, Merouane Debbah, Houbing Song, Lingjia Liu

机构 * BrainOmega and the Technical University of Catalonia (UPC)(BrainOmega 和 哈佛大学(UPC)) Centre Tecnologic de Telecomunicacions de Catalunya (CTTC/CERCA)(巴塞罗那电信技术中心(CTTC/CERCA)) i2CAT Foundation(i2CAT 基金会) Khalifa University of Science and Technology(科技 Khalifa 大学) University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩分校(UMBC)) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于世界建模的智能体框架WM-MS3M,通过生成式状态空间实现6G网络近实时反事实推理与资源分配,在O-RAN数据上降低预测误差并加速推理。

Comments 13 Pages, 3 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04691 2026-06-04 cs.CL 77%

SMADE-IE: Sparse Multi-Agent Framework with Evidence-Driven Debate for Zero-Shot Information Extraction

SMADE-IE: 基于证据驱动辩论的稀疏多智能体框架用于零样本信息抽取

Kenfeng Huang, Yi Cai, Xin Wu, Zikun Deng, Li Yuan

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出SMADE-IE稀疏多智能体框架,通过自适应模式选择器和证据驱动辩论机制,在零样本信息抽取中减少冗余交互并提升性能。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14054 2026-06-04 cs.AI cs.CV 77%

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。

Comments Accepted by ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏