arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-28 至 2026-01-28 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 13 篇

2510.20691 2026-01-28 cs.AI 85%

Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs

计划后再检索:强化学习引导的知识图谱复杂推理

Yanlin Song, Ben Liu, Víctor Gutiérrez-Basulto, Zhiwei Hu, Qianqian Xie, Min Peng, Sophia Ananiadou, Jeff Z. Pan

机构 * School of Computer Science(计算机科学学院) Wuhan University(武汉大学) School of Computer Science and Informatics(计算机科学与信息学院) Cardiff University(卡迪夫大学) College of Information Science and Engineering(信息科学与工程学院) Shanxi Agricultural University(山西农业大学) School of Artificial Intelligence(人工智能学院) Center for Language and Information Research(语言与信息研究中心) University of Manchester(曼彻斯特大学) ILCC, School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 Graph-RFT通过强化学习引导的知识图谱复杂推理框架,实现自主规划与适应性检索调度,解决KGQA中的冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19588 2026-01-28 cs.LG cs.AI 84%

From Atoms to Chains: Divergence-Guided Reasoning Curriculum for Unlabeled LLM Domain Adaptation

从原子到链:基于分歧引导的推理课程用于无标签LLM领域适应

Yongqi Wang, Xiaofeng Ji, Jie Wang, Qingbin Li, Xiao Xiong, Zheming Yang, Jian Xu, Minghui Qiu, Xinxiao Wu

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ByteDance China(字节跳动中国)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGRC方法,通过分歧引导构建从原子知识到推理链的学习课程,提升无标签LLM在医疗和法律领域适应性能。

Comments Code: https://github.com/bytedance/DGRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19290 2026-01-28 cs.CL 79%

MetaGen: Self-Evolving Roles and Topologies for Multi-Agent LLM Reasoning

MetaGen: 多智能体LLM推理中的自演化角色与拓扑

Yimeng Wang, Jiaxing Zhao, Hongbin Xie, Hexing Ma, Yuzhen Lei, Shuangxue Liu, Xuan Song, Zichen Zhang, Haoran Zhang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MetaGen通过自演化角色和拓扑提升多智能体LLM推理的准确性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06201 2026-01-28 cs.LG 79%

K2-V2: A 360-Open, Reasoning-Enhanced LLM

K2-V2:一种360开放、推理增强的LLM

K2 Team, Zhengzhong Liu, Liping Tang, Linghao Jin, Haonan Li, Nikhil Ranjan, Desai Fan, Shaurya Rohatgi, Richard Fan, Omkar Pangarkar, Huijuan Wang, Zhoujun Cheng, Suqi Sun, Seungwook Han, Bowen Tan, Gurpreet Gosal, Xudong Han, Varad Pimpalkhute, Shibo Hao, Ming Shan Hee, Joel Hestness, Haolong Jia, Liqun Ma, Aaryamonvikram Singh, Daria Soboleva, Natalia Vassilieva, Renxi Wang, Yingquan Wu, Yuekai Sun, Taylor Killian, Alexander Moreno, John Maggs, Hector Ren, Guowei He, Hongyi Wang, Xuezhe Ma, Yuqi Wang, Mikhail Yurochkin, Eric P. Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 K2-V2是一种通过注入领域知识、推理、长上下文和工具使用能力,提升复杂推理任务性能的360开放LLM,具备强大的推理能力和开源训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19686 2026-01-28 cs.CV 78%

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

Video-KTR: 通过关键令牌 attribution 增强视频推理

Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang

机构 * ByteDance(字节跳动) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) National University of Singapore(国立新加坡大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 Video-KTR通过结合三种attribution信号,提升视频推理的准确性和可解释性,实现状态-of-the-art性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19337 2026-01-28 cs.AI cs.LG cs.SE 62%

SETA: Statistical Fault Attribution for Compound AI Systems

SETA:复合人工智能系统的统计故障归因

Sayak Chowdhury, Meenakshi D'Souza

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SETA提出了一种模块化鲁棒性测试框架,用于分析复合人工智能系统的故障归因,通过组件级分析和错误传播推理,实现细粒度的鲁棒性评估。

Comments Accepted to CAIN 2026 co-hosted with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19871 2026-01-28 cs.CL 57%

Reflective Translation: Improving Low-Resource Machine Translation via Structured Self-Reflection

反思性翻译:通过结构化自我反思改进低资源机器翻译

Nicholas Cheng

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出反思性翻译框架,通过结构化自我反思提升低资源语言的机器翻译质量,实验表明其在BLEU和COMET评分上均有显著提升。

Comments 12 pages, 3 figures, 6 tables. Accepted to the NeurIPS 2025 Workshop on Multilingual Representation Learning (Mexico City) and the AAAI 2025 Workshop on Language Models for Under-Resourced Communities (LM4UC). Code and data available at: https://github.com/Nickcheng123/reflective-translation-mt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19053 2026-01-28 cs.HC cs.AI 57%

From Answer Givers to Design Mentors: Guiding LLMs with the Cognitive Apprenticeship Model

从答案提供者到设计导师:通过认知 apprenticeship 模型引导 LLMs

Yongsu Ahn, Lejun R Liao, Benjamin Bach, Nam Wook Kim

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化技术研究院) University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过认知 apprenticeship 模型引导 LLMs 作为设计导师,提升设计推理和反思反馈质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13887 2026-01-28 cs.AI 57%

Human Simulation Computation: A Human-Inspired Framework for Adaptive AI Systems

人类模拟计算:一种受人类启发的自适应人工智能系统框架

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出人类模拟计算框架,通过结合人类思维策略与行动反馈,提升AI在动态环境中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23581 2026-01-28 cs.LG 57%

GraphRAG-R1: Graph Retrieval-Augmented Generation with Process-Constrained Reinforcement Learning

GraphRAG-R1: 基于过程约束强化学习的图检索增强生成

Chuanyue Yu, Kuo Zhao, Yuhan Li, Heng Chang, Mingjian Feng, Xiangzhe Jiang, Yufei Sun, Jia Li, Yuzhi Zhang, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Huawei Technologies Ltd(华为技术有限公司) Beihang University(北航)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 GraphRAG-R1通过过程约束强化学习提升LLM多跳推理能力,结合改进的GRPO方法和两种新型奖励函数,有效解决复杂问题。

Comments Accepted by the Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18924 2026-01-28 cs.AI 57%

RIFT: Reordered Instruction Following Testbed To Evaluate Instruction Following in Singular Multistep Prompt Structures

RIFT:重新排列指令跟随测试床以评估单步提示结构中的指令跟随

Andrew Jaffe, Noah Reicin, Jinho D. Choi

机构 * Emory University(埃默里大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RIFT通过测试不同提示结构下的LLM表现,揭示了指令跟随对位置连续性的强依赖,指出当前架构将指令跟随视为顺序模式而非推理能力。

Comments 13 pages, 5 figures, submitted to ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18847 2026-01-28 cs.SE cs.AI 57%

MulVul: Retrieval-augmented Multi-Agent Code Vulnerability Detection via Cross-Model Prompt Evolution

MulVul: 通过跨模型提示进化实现检索增强的多智能体代码漏洞检测

Zihan Wu, Jie Xu, Yun Peng, Chun Yong Chong, Xiaohua Jia

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 MulVul通过跨模型提示进化实现多智能体代码漏洞检测,采用由粗到细的策略,利用检索工具提升漏洞识别精度,达到34.79%的Macro-F1成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01255 2026-01-28 cs.SE 50%

TestWeaver: Execution-aware, Feedback-driven Regression Testing Generation with Large Language Models

TestWeaver: 基于执行意识和反馈驱动的回归测试生成方法

Cuong Chi Le, Cuong Duc Van, Tung Duy Vu, Thai Minh Pham Vu, Hoang Nhat Phan, Huy Nhat Phan, Tien N. Nguyen

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TestWeaver通过整合轻量级程序分析和针对性执行上下文,提升LLM在回归测试生成中的覆盖率和效率。

Comments Accepted in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 20 篇

2510.11027 2026-01-28 cs.CV 82%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18984 2026-01-28 cs.LG cs.CL 81%

Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning

保存好的前缀:通过过程监督强化学习实现精确误差惩罚以增强大语言模型推理

Haolin Liu, Dian Yu, Sidi Lu, Yujun Zhou, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Virginia(弗吉尼亚大学) University of Notre Dame(圣母大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过过程监督强化学习实现精确误差惩罚,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15600 2026-01-28 cs.AI cs.CL 81%

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

通过结构化组件奖励机制解锁生物实验协议生成中的科学推理

Haoran Sun, Yankai Jiang, Zhenyu Tang, Yaning Pan, Shuang Gu, Zekai Lin, Lilong Wang, Wenjie Lou, Lei Liu, Lei Bai, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过结构化组件奖励机制,Thoth在多个基准测试中超越了现有LLMs,实现了更准确的生物实验协议生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19773 2026-01-28 cs.CL 79%

Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis

强推理并不足够:评估交互诊断中的证据获取

Zhuohan Long, Zhijie Bao, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出REFINE策略,通过诊断验证引导代理主动解决不确定性,提升交互诊断中证据获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02091 2026-01-28 cs.AI 79%

Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning

解析大语言模型中层的作用:检索、知识与推理

Xinyuan Song, Keyu Wang, PengXiang Li, Lu Yin, Shiwei Liu

机构 * Emory University(埃默里大学) University of Tuebingen(图宾根大学) University of Surrey(萨里大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究解析了大语言模型中不同深度层在检索、知识和推理中的作用,发现浅层主导知识和检索,深层影响推理,且不同评估方法下深度利用存在显著差异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19540 2026-01-28 cs.HC 78%

"Do I Trust the AI?" Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Reasoning

我是否信任AI?:迈向可信的AI辅助诊断:理解用户在LLM支持推理中的感知

Yuansong Xu, Yichao Zhu, Haokai Wang, Yuchen Wu, Yang Ouyang, Hanlu Li, Wenzhe Zhou, Xinyu Liu, Chang Jiang, Quan Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文研究医生对LLM临床推理能力的感知,通过实验揭示医生对LLM诊断能力的评估,并探讨提升医生与LLM协作可信度的方法。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19306 2026-01-28 cs.AI 70%

Curiosity Driven Knowledge Retrieval for Mobile Agents

基于好奇心的知识检索用于移动代理

Sijia Li, Xiaoyu Tan, Shahir Ali, Niels Schmidt, Gengchen Ma, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出一种基于好奇心的知识检索框架,通过结构化AppCards提升移动代理在复杂任务中的规划可靠性与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19514 2026-01-28 cs.CL cs.AI cs.LG 67%

SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback

SIPDO:通过合成数据反馈实现闭环提示优化

Yaoning Yu, Ye Yu, Peiyan Zhang, Kai Wei, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) University of South Florida(佛罗里达州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIPDO通过合成数据反馈闭环优化提示,提升提示性能并优于传统提示微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17912 2026-01-28 cs.LG cs.AI 62%

Causal Pre-training Under the Fairness Lens: An Empirical Study of TabPFN

从公平性视角看因果预训练:对TabPFN的实证研究

Qinyi Liu, Mohammad Khalil, Naman Goel

机构 * University of Bergen Centre for the Science of Learning \& Technology (SLATE) Bergen Norway Department of Computer Science University of Oxford Alan Turing Institute Oxford United Kingdom University of Bergen University of Oxford Alan Turing Institute

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究从公平性角度评估了TabPFN的因果预训练效果,发现其在预测准确性上表现优异,但在公平性改进方面存在局限,特别是在面对缺失-不在随机协变量偏移时。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09342 2026-01-28 cs.CL cs.AI 62%

Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework

通过社区驱动的多智能体框架改进隐式仇恨言论检测

Ewelina Gajewska, Katarzyna Budzynska, Jarosław A Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种社区驱动的多智能体框架,通过整合社会文化背景提升隐式仇恨言论检测的准确性和公平性。

Comments This paper has been accepted for the upcoming 18th International Conference on Agents and Artificial Intelligence (ICAART-2026), Marbella, Spain. The final published version will appear in the official conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-01-28 cs.CL cs.AI cs.IR 62%

LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 57%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 57%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 57%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01509 2026-01-28 cs.CL 57%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏