arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-24 至 2026-02-24 共收录 143 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 16 篇

2602.18884 2026-02-24 cs.AI 57%

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

TPRU: 推动大型多模态模型中的时序与过程理解

Zhenkun Gao, Xuhong Wang, Xin Tan, Yuan Xie

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。

Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18745 2026-02-24 cs.CV cs.AI 57%

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

从零开始合成多模态几何数据集并借助绘图代码实现视觉对齐

Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GeoCode数据集,通过代码预测实现视觉对齐,提升多模态几何推理性能。

Comments 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18630 2026-02-24 cs.HC cs.AI 57%

Lost in Instructions: Study of Blind Users' Experiences with DIY Manuals and AI-Rewritten Instructions for Assembly, Operation, and Troubleshooting of Tangible Products

迷失在指令中:对盲人用户使用DIY手册和AI重写指令进行实物产品组装、操作和故障排除经验的研究

Monalika Padma Reddy, Aruna Balasubramanian, Jiawei Zhou, Xiaojun Bi, IV Ramakrishnan, Vikas Ashok

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨盲人用户在使用DIY手册和AI生成的指令进行实物产品组装、操作和故障排除时的体验,发现现有工具不足,需改进以提供更有效的指导。

Comments 28 pages incl. references, 7 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview and usability study with 15 blind participants

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01696 2026-02-24 cs.CV cs.AI 57%

Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection

跨模态净化与融合用于小物体RGB-D传输线缺陷检测

Jiaming Cui, Wenqiang Li, Shuai Zhou, Ruifeng Qin, Feng Shen

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(机械电子工程学院,哈尔滨工业大学) School of Instrument Science and Engineering, Harbin Institute of Technology(仪器科学与工程学院,哈尔滨工业大学) Electric Power Research Institute, Yunnan Power Grid Co., Ltd.(电力研究院,云南电网公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CMAFNet通过跨模态净化与融合技术,提升小物体RGB-D传输线缺陷检测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20648 2026-02-24 cs.CV 50%

LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

LocateAnything3D: 基于视觉-语言的3D检测与链式视觉推理

Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Zhiqi Li, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding Yu

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 LocateAnything3D通过将3D检测转化为下一个token预测问题,实现了多目标3D检测,取得了Omni3D基准测试中的最佳成绩。

Comments Tech report. Project page: https://nvlabs.github.io/LocateAnything3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19505 2026-02-24 cs.CV 50%

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19063 2026-02-24 cs.CV 50%

Direction-aware 3D Large Multimodal Models

具有方向感知的3D大多模态模型

Quan Liu, Weihao Xuan, Junjue Wang, Naoto Yokoya, Ling Shao, Shijian Lu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出方向感知的3D大多模态模型,通过补充自身姿态并改进点云数据对齐,提升3D多模态模型的性能和通用性。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10116 2026-02-24 cs.CV cs.RO 50%

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

SAGE: 适用于具身人工智能的可扩展代理3D场景生成

Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung-Yi Lin, Wei-Chiu Ma, Shenlong Wang, Shuran Song, Fangyin Wei

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SAGE通过代理框架生成可扩展的3D环境,用于具身人工智能的策略训练和泛化能力提升。

Comments Project Page: https://research.nvidia.com/labs/dir/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 5 篇

2602.20130 2026-02-24 cs.CL cs.AI 86%

To Reason or Not to: Selective Chain-of-Thought in Medical Question Answering

推理还是不推理:医学问答中的选择性推理

Zaifu Zhan, Min Zeng, Shuang Zhou, Yiran Song, Xiaoyi Chen, Yu Hou, Yifan Wu, Yang Ruan, Rui Zhang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Minnesota(明尼苏达大学) Division of Computational Health Sciences, Department of Surgery(计算健康科学 division,外科系) Department of Computer Science and Engineering(计算机科学与工程系) Health Data Science, School of Public Health(公共卫生学院健康数据科学系)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 选择性推理通过动态调整推理深度和效率,提升医学问答的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19169 2026-02-24 cs.LG cs.AI cs.MS math.PR 81%

Virtual Parameter Sharpening: Dynamic Low-Rank Perturbations for Inference-Time Reasoning Enhancement

虚拟参数锐化:用于推理时间推理增强的动态低秩扰动

Saba Kublashvili

机构 * Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 虚拟参数锐化通过动态低秩扰动提升大语言模型推理能力,实现测试时间适应与高效推理增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15937 2026-02-24 cs.AI 79%

Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment

推进移动GUI代理:一种以验证器驱动的方法用于实际部署

Gaole Dai, Shiqi Jiang, Ting Cao, Yuanchun Li, Yuqing Yang, Rui Tan, Mo Li, Lili Qiu

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率

Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19519 2026-02-24 cs.AI cs.LG 73%

Ada-RS: Adaptive Rejection Sampling for Selective Thinking

Ada-RS: 选择性思维的自适应拒绝采样

Yirou Ge, Yixi Li, Alec Chiu, Shivani Shekhar, Zijie Pan, Avinash Thangali, Yun-Shiuan Chuang, Chaitanya Kulkarni, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08783 2026-02-24 cs.LG cs.AI cs.CL cs.NA math.NA 67%

CodePDE: An Inference Framework for LLM-driven PDE Solver Generation

CodePDE:基于LLM的PDE求解器生成推理框架

Shanda Li, Tanya Marwah, Junhong Shen, Weiwei Sun, Andrej Risteski, Yiming Yang, Ameet Talwalkar

机构 * Carnegie Mellon University(卡内基梅隆大学) Flatiron Institute(Flatiron研究院) Polymathic AI(多学科人工智能) Datadog

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CodePDE通过大语言模型生成PDE求解器,展示了LLM在复杂数学问题中的强大能力及潜在应用价值。

Comments TMLR. Code available at https://github.com/LithiumDA/CodePDE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 11 篇

2602.18447 2026-02-24 cs.CL cs.AI 84%

ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification

ConfSpec:通过置信度门控验证实现高效的步骤级推测推理

Siran Liu, Cyril Y. He

机构 * Peking University(北京大学) ScitiX AI

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ConfSpec通过置信度门控验证框架,在保持准确性的同时,实现高效步骤级推测推理,达到2.24倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19240 2026-02-24 cs.AI 83%

Topology of Reasoning: Retrieved Cell Complex-Augmented Generation for Textual Graph Question Answering

推理拓扑:检索细胞复杂度增强的生成用于文本图问题回答

Sen Zhao, Lincheng Zhou, Yue Chen, Ding Zou

机构 * Academy of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学先进交叉学科研究院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴电信设备智能系统部)

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出TopoRAG,通过将文本图提升为细胞复杂度,捕捉高维拓扑依赖,提升文本图问题回答的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23038 2026-02-24 cs.CL cs.AI cs.LG 82%

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

通过工具集成强化学习激励LLM裁判的代理推理

Ran Xu, Jingjing Chen, Jiayu Ye, Yu Wu, Jun Yan, Carl Yang, Hongkun Yu

机构 * Emory University(埃默里大学) Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TIR-Judge通过工具集成强化学习提升LLM裁判的推理能力,在多个基准测试中取得显著成效。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15077 2026-02-24 cs.LG cs.DB 79%

Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL

Think2SQL: 通过可验证奖励强化学习增强大语言模型的推理能力以实现文本到SQL

Simone Papicchio, Simone Rossi, Luca Cagliero, Paolo Papotti

机构 * Politecnico di Torino(托斯卡纳理工学院) EURECOM

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Think2SQL方法,通过可验证奖励强化学习增强大语言模型的推理能力,提升文本到SQL任务的性能。

Comments 26 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13614 2026-02-24 cs.CL 79%

MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning

MemoTime: 带记忆的时序知识图增强大语言模型推理

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW Data61(新南威尔士大学Data61) CSIRO(澳大利亚联邦科学与工业研究组织) UNSW Sydney Australia(新南威尔士大学悉尼分校) Data61, CSIRO(Data61,澳大利亚联邦科学与工业研究组织)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MemoTime通过带记忆的时序知识图框架提升LLM的时序推理能力,解决多跳推理、多实体同步、运算符适应和经验重用等挑战,实现先进性能。

Comments Accepted by The Web Conference 2026 (WWW, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG 70%

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12066 2026-02-24 cs.AI cs.LG 62%

AI Agents as Universal Task Solvers

AI代理作为通用任务求解器

Alessandro Achille, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将AI代理视为随机动态系统,通过归纳推理框架,探讨学习推理的算法结构,揭示任务解决时间与算法信息的关系,并指出在无限制模型规模下,奖励信号可能导致暴力求解而非可转移策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19844 2026-02-24 cs.CR cs.AI cs.SE 57%

LLM-enabled Applications Require System-Level Threat Monitoring

依赖大语言模型的应用需要系统级威胁监控

Yedi Zhang, Haoyu Wang, Xianglin Yang, Jin Song Dong, Jun Sun

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19158 2026-02-24 cs.AI 57%

DoAtlas-1: A Causal Compilation Paradigm for Clinical AI

DoAtlas-1:一种用于临床AI的因果编译范式

Yulong Li, Jianxu Chen, Xiwei Liu, Chuanyue Suo, Rong Xia, Zhixiang Lu, Yichen Li, Xinlin Zhuang, Niranjana Arun Menon, Yutong Xie, Eran Segal, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DoAtlas-1通过因果编译范式将医学证据转化为可执行代码,提升临床AI的可审计性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00574 2026-02-24 cs.LG 57%

Bayesian Network Structure Discovery Using Large Language Models

利用大语言模型进行贝叶斯网络结构发现

Yinghuan Zhang, Yufei Zhang, Parisa Kordjamshidi, Zijun Cui

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种利用大语言模型进行贝叶斯网络结构发现的统一框架,支持数据自由和数据感知设置,在无数据场景下通过PromptBN生成完整DAG,在有数据时通过ReActBN进一步优化结构。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12268 2026-02-24 cs.AI 57%

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习

Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 41 篇

2602.18806 2026-02-24 cs.CL cs.AI 88%

Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models

Think$^{2}$: 大语言模型中的 grounded 元认知推理

Abraham Paul Elenjical, Vivek Hruday Kavuri, Vasudeva Varma

机构 * IIIT Hyderabad(IIIT海得拉尔)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);self-correction(abstract)

AI总结 Think$^{2}$通过引入基于心理理论的元认知框架,提升大语言模型的自我诊断与纠正能力,显著提高推理准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20117 2026-02-24 cs.AI cs.LG 84%

ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models

ReSyn:自主扩展合成环境以增强推理模型

Andre He, Nathaniel Weir, Kaj Bostrom, Allen Nie, Darion Cassel, Sam Bayless, Huzefa Rangwala

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 ReSyn通过生成多样化推理环境,利用验证器监督和任务多样性提升推理语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19455 2026-02-24 cs.LG cs.AI cs.CL stat.ML 82%

SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning

SenTSR-Bench: 带注入知识的思考以实现时间序列推理

Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang Fang, Danielle C. Maddix, Abdul Fatir Ansari, Akash Chandrayan, Abhinav Pradhan, Bernie Wang, Matthew Reimherr

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AWS AI Labs(AWS人工智能实验室) Amazon RME Project(亚马逊RME项目)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SenTSR-Bench通过注入领域知识提升时间序列推理能力,结合强化学习方法实现高效的知识注入,方法在多个数据集上显著优于现有模型。

Comments Accepted by the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19895 2026-02-24 cs.LG cs.CL 81%

DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning

DSDR:双尺度多样性正则化用于LLM推理中的探索

Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui Shen, Jing Xiong, Chaofan Tao, Zixuan Zhong, Peizhou Huang, Mi Zhang

机构 * The Ohio State University, USA(俄亥俄州立大学) Case Western Reserve University, USA(凯斯西储大学) The Chinese University of Hong Kong, Hong Kong(香港中文大学) Macquarie University, Australia(麦考瑞大学) University of Michigan, USA(密歇根大学) The University of Hong Kong, Hong Kong(香港大学) University College London, UK(伦敦大学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DSDR通过双尺度多样性正则化提升LLM推理中的探索能力,通过全局和局部正则化机制增强路径多样性,提高学习信号稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17053 2026-02-24 cs.AI cs.CL 81%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13370 2026-02-24 cs.MA cs.AI cs.CL 81%

G2CP: A Graph-Grounded Communication Protocol for Verifiable and Efficient Multi-Agent Reasoning

G2CP:一种基于图的可验证和高效的多智能体推理通信协议

Karim Ben Khaled, Davy Monticolo

机构 * University of Lorraine, LORIA(洛林大学,LORIA)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 G2CP通过图操作实现多智能体高效、可验证的推理通信,提升任务准确率并消除幻觉传播。

详情

展开后加载摘要…

URL PDF HTML 收藏