arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 275 篇

2509.01412 2026-06-26 cs.CL 版本更新 94%

Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning

Vis-CoT:一种用于LLM思维链推理中交互式可视化和干预的人机协同框架

Kaviraj Pather, Elena Hadjigeorgiou, Arben Krasniqi, Claire Schmit, Irina Rusu, Marc Pons, Kabir Khan

专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 提出Vis-CoT框架,将线性思维链文本转换为交互式推理图,允许用户可视化逻辑流程、识别错误步骤并通过剪枝和嫁接进行干预,显著提升推理准确性和用户信任。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14888 2026-08-06 cs.CL cs.AI cs.CV cs.LG 版本更新 90%

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

推理动态与监控模态依赖性的局限性

Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott

机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。

Comments Accepted for publication in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13904 2026-07-24 cs.AI 版本更新 90%

Diagnosing Pathological Chain-of-Thought in Reasoning Models

诊断推理模型中的病理链式思维

Manqing Liu, David Williams-King, Ida Caspary, Linh Le, Hannes Whittingham, Puria Radmard, Cameron Tice, Edward James Young

机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) Imperial College London, London, UK(伦敦帝国学院) McGill University, Montreal, Canada(麦吉尔大学) Geodesic Research, Cambridge, UK(Geodesic研究)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16728 2026-07-14 cs.LG 版本更新 90%

The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models

推理的成本:链式推理诱导视觉-语言模型的过度自信

Robert Welch, Emir Konuk, Kevin Smith

机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25800 2026-08-11 cs.LG cs.CL 版本更新 89%

Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

变压器通用推理的障碍(以及如何克服它们)

Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

机构 * Saarland University(萨尔兰大学) Ohio State University(俄亥俄州立大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了Transformer在长CoT轨迹上的泛化能力限制,并提出通过动态词汇增长和符号标记实现长度可扩展性。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07368 2026-06-15 cs.LG cs.AI 版本更新 89%

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

后训练中的分布偏差:推理轨迹的马尔可夫分析

Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki

机构 * City University of Hong Kong(香港城市大学) Center for Advanced Intelligence Project, RIKEN(RIKEN高级智能研究中心) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(A*STAR的CFAR和IHPC) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过马尔可夫链模型分析后训练策略(如RLVR和ORM/PRM)如何强化高概率路径而遗忘稀有但关键的推理步骤,并证明探索策略(如拒绝简单实例和KL正则化)有助于保留稀有CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18079 2026-08-10 cs.LG cs.CC cs.CL 版本更新 88%

The Expressive Power of Low Precision Softmax Transformers with (Summarized) Chain-of-Thought

低精度softmax变换器的表达能力(摘要)链式思维

Moritz Brösamle, Stephan Eckstein

机构 * Department of Mathematics, University of Tübingen, Germany(图宾根大学数学系)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了低精度softmax变换器在链式思维中的表达能力,通过构造三元激活和分离注意力分数的硬max变换器来模拟图灵机,从而将构造转换为等效的softmax变换器,并分析了最近提出的总结链式思维范式在模拟图灵机时的效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17686 2026-07-14 cs.LG cs.AI 版本更新 88%

BRIDGE: Bridging Reasoning In Distillation Gap Elimination via Structure-Aware Masking

通过结构感知掩码和GRPO实现高效的链式推理知识蒸馏课程学习

Bowen Yu, Sheng Zhang, Binhao Wang, Yi Wen, Jingtong Gao, Bowen Liu, Zimo Zhao, Shanshan Ye, Wanyu Wang, Maolin Wang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过结构感知掩码和GRPO实现高效的链式推理知识蒸馏,提升学生模型的准确率和输出简洁性。

Comments 14 pages, 13 figures. Accepted at SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26846 2026-06-08 cs.LG cs.AI 版本更新 88%

Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry

稳定推理,不稳定响应:通过稳定性不对称缓解大语言模型欺骗

Guoxi Zhang, Jiawei Chen, Tianzhuo Yang, Lang Qin, Juntao Dai, Yaodong Yang, Jingwei Yi

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Chinese as a Second Language, Peking University(北京大学第二语言学院)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型内在欺骗问题,提出稳定性不对称正则化(SAR),通过惩罚内部思维链稳定性与外部响应稳定性之间的不对称性来抑制欺骗,实验证明其有效性且不损害模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02130 2026-07-27 cs.AI cs.LG 版本更新 87%

Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning

Re-FORC:用于高效思维链推理的自适应奖励预测

Renos Zabounidis, Aditya Golatkar, Michael Kleinman, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能代理部门) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG

AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。

Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10229 2026-07-13 cs.CL 版本更新 87%

Latent Thoughts Tuning: Bridging Context and Reasoning with Fused Information in Latent Tokens

潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理

Weihao Liu, Dehai Min, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。

Comments In Proceedings of the Forty-third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25741 2026-07-03 cs.CL 版本更新 87%

Scaling Latent Reasoning via Looped Language Models

通过循环语言模型扩展潜在推理

Rui-Jie Zhu, Zixuan Wang, Kai Hua, Tianyu Zhang, Ziniu Li, Haoran Que, Boyi Wei, Zixin Wen, Fan Yin, He Xing, Lu Li, Jiajun Shi, Kaijing Ma, Shanda Li, Taylor Kergan, Andrew Smith, Xingwei Qu, Mude Hui, Bohong Wu, Qiyang Min, Hongzhi Huang, Xun Zhou, Wei Ye, Jiaheng Liu, Jian Yang, Yunfeng Shi, Chenghua Lin, Enduo Zhao, Tianle Cai, Ge Zhang, Wenhao Huang, Yoshua Bengio, Jason Eshraghian

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出Ouro系列循环语言模型,通过在潜在空间迭代计算、熵正则化深度分配和扩展至7.7T令牌,实现优于更大模型的推理性能,并展示其知识操控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06374 2026-08-05 cs.CL cs.LG 版本更新 87%

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

叠加的幻觉?语言模型中潜在思维的原理性分析

Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了连续链式思维(Latent CoT)中叠加现象的出现条件,发现仅从头训练的模型表现出叠加特性,而其他训练方式下模型倾向于使用捷径解法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20710 2026-08-10 cs.AI cs.CL 版本更新 86%

Counterfactual Simulation Training for Chain-of-Thought Faithfulness

反事实模拟训练用于思维链可信度

Peter Hase, Christopher Potts

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出反事实模拟训练方法,通过奖励使模拟器准确预测模型输出来提升思维链的可信度,并在不同设置中验证其有效性。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14142 2026-08-03 cs.CL cs.AI 版本更新 86%

Implicit Reasoning for Large Language Model-based Generative Recommendation

基于大语言模型的生成式推荐的隐式推理

Yinhan He, Liam Collins, Bhuvesh Kumar, Jundong Li, Neil Shah, Donald Loveland

机构 * University of Virginia(弗吉尼亚大学) Snap Inc.(Snap公司)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大语言模型用于生成式推荐时显式推理的三大局限(世界知识表达弱化、语义ID与自然语言嵌入空间不对齐、推理质量敏感),提出轻量级隐式推理范式PauseRec,在性能、训练成本和推理速度上均优于显式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26795 2026-07-28 cs.AI 版本更新 85%

What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation

链式思维在探测时为何有效?局部共现而非全局推导

Xiang Wang, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 研究链式思维提示在探测时提升语言模型准确率的原因,发现增益主要来自词汇激活和短距离标记共现,而非句子级逻辑推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-07-17 cs.CV 版本更新 85%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13903 2026-07-16 cs.MA cs.AI cs.LG 版本更新 84%

Benefits and Limitations of Communication in Multi-Agent Reasoning

多智能体推理中通信的益处与局限性

Michael Rizvi-Martel, Satwik Bhattamishra, Neil Rathi, Guillaume Rabusseau, Michael Hahn

机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) University of Oxford(牛津大学) Stanford University(斯坦福大学) Saarland University(萨尔兰大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体推理中通信的益处与局限,提出理论框架分析其表达能力,应用于三个算法族,得出相关界限,通过实验验证关键量权衡,为设计可扩展多智能体推理系统提供指导。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11149 2026-08-11 cs.CL 版本更新 83%

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

数据重复胜过数据扩展在长链推理监督微调中

Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

机构 * University of Technology Nuremberg(图恩大学) NVIDIA(英伟达)

专题命中 其他推理 :CoT(title);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究发现,在长链推理监督微调中,数据重复训练比数据扩展更有效,通过token准确率作为停止标准可替代昂贵的数据扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04330 2026-07-29 cs.AI cs.CC cs.LO cs.SC 版本更新 83%

The Scaling Properties of Implicit Deductive Reasoning in Transformers

深度受限Transformer中隐式演绎推理的缩放属性

Enrico Vompa, Tanel Tammet

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 研究深度受限Transformer中隐式演绎推理的缩放属性,通过去相关联和强制对齐,发现足够深模型中隐式推理接近显式思维链性能,且思维链对深度外推必要。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01170 2026-07-14 cs.IR cs.AI 版本更新 83%

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Diffusion-GR2: 扩散生成推理重排序器

Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu

机构 * Meta AI UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出Diffusion-GR2,通过转换微调、在线策略蒸馏和强化学习将自回归推理重排序器转换为块扩散模型,在保持精度的同时将推理吞吐量提升2.4-3.5倍。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22954 2026-06-15 cs.CL cs.AI 版本更新 82%

Residual Context Diffusion Language Models

残差上下文扩散语言模型

Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman Hooper, Jintao Zhang, Aditya Tomar, Michael W. Mahoney, Sewon Min, Mehrdad Farajtabar, Kurt Keutzer, Amir Gholami, Chenfeng Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出残差上下文扩散(RCD)模块,通过回收丢弃令牌的上下文残差提高扩散语言模型的解码效率,在长/短CoT任务上以极少额外计算提升准确率4-11个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28186 2026-08-11 cs.CL cs.AI cs.CY cs.LG 版本更新 82%

Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction

LLM推理轨迹中的认知片段实现可解释的人类项目难度预测

Chenguang Wang, Ming Li, Xinyue Zeng, Zhuochun Li, Hong Jiao, Tianyi Zhou, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) University of Maryland(马里兰大学) MBZUAI(穆桑大学人工智能研究所) University of Pittsburgh(匹兹堡大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Epi2Diff框架,将大型推理模型的推理轨迹映射为认知片段序列,通过推理规模、努力分配和状态转换建模项目难度,在真实数据集上优于基线方法。

Comments 32 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05547 2026-08-06 cs.CL cs.AI cs.LG 版本更新 82%

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

多任务GRPO:跨任务的可靠大语言模型推理

Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong Wang, Haitham Bou Ammar, Aurelien Lucchi, Ilija Bogunovic

机构 * UCL Department of EEE(伦敦大学学院电子工程系) UCL Centre for AI(伦敦大学学院人工智能中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UNIST Graduate School of AI(延世大学人工智能研究生院) University of Edinburgh(爱丁堡大学) University of Basel(巴塞尔大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MT-GRPO算法,通过动态调整任务权重和比例保持采样器,提升多任务场景下大语言模型的可靠推理性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21495 2026-07-01 cs.LG cs.AI cs.CL 版本更新 82%

Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

通过操作草图和自监督学习推广表格数据中的数值推理

Hanjun Cho, Gahyun Yoo, Hanseong Kim, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TaNOS框架,通过操作草图和自监督学习提升表格数据中数值推理的泛化能力,实验显示其在FinQA数据集上表现优异,且在领域转移中鲁棒性更强。

Comments Accepted to TACL. This is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24481 2026-06-08 cs.AI cs.CL cs.LG 版本更新 82%

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

基于一致性验证的多智能体推理改进医学多项选择题问答中的不确定性校准

John Ray B. Martinez

机构 * Department of Data Science and Analytics(数据科学与分析系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多智能体框架,结合领域专家智能体与两阶段验证及S分数加权融合,在医学MCQA中显著降低校准误差并提升判别能力。

Comments 20 pages, 6 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00229 2026-06-09 cs.RO cs.AI cs.LG 版本更新 82%

Continuous Reasoning for Vision-Language-Action

视觉-语言-动作的连续推理

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对视觉-语言-动作策略中语言与连续控制粒度不匹配的问题,提出一种可共享、可验证的连续推理方法,通过高斯潜变量接口和自验证目标提升机器人任务成功率。

Comments Project page: https://continuous-reasoning.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-20 cs.LG cs.AI cs.CV 版本更新 81%

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21137 2026-08-18 cs.CL cs.AI 版本更新 81%

Enhancing Science Classroom Discourse Analysis through Joint Multi-Task Learning for Reasoning-Component Classification

通过联合多任务学习增强科学课堂话语分析以进行推理组件分类

Jiho Noh, Mukhesh Raghava Katragadda, Raymond Carl, Soon Lee

机构 * Department of Computer Science, Kennesaw State University(肯纳邦大学计算机科学系) Bagwell College of Education, Kennesaw State University(肯纳邦大学巴格威尔教育学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ADAS系统,通过联合多任务学习对教师和学生话语进行类型和推理组件分类,解决少数类标签不平衡问题,提升课堂话语分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08879 2026-08-18 cs.CL cs.AI 版本更新 81%

CulTrace: Tracing Internal Cultural Reasoning in Large Language Models

纠缠于表征:大型语言模型中文化偏见的机制性探究

Haeun Yu, Arnav Arora Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏