arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2604.19300 2026-04-22 cs.SD cs.AI 57%

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

HalluAudio:大型音频-语言模型中幻觉检测的综合基准

Feiyu Zhao, Yiming Chen, Wenhuan Lu, Daipeng Zhang, Xianghu Yue, Jianguo Wei

机构 * College of Intelligence and Computing, Tianjin University, China(天津大学智能计算学院) ASUS Intelligent Cloud Services, Singapore(ASUS智能云服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HalluAudio是首个大规模评估语音、环境声音和音乐中幻觉的基准,包含5000多对人工验证的问答对,通过对抗性提示和混合音频条件系统诱导幻觉,评估准确率、幻觉率、偏差等,揭示了大型音频-语言模型在声音接地、时间推理和音乐属性理解上的缺陷。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18982 2026-04-22 cs.AI 57%

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

SAVOIR:通过基于Shapley的奖励归因学习社交能力

Xiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Yuxuan Gu, Chonghan Qin, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SAVOIR框架,基于合作博弈理论解决语言代理训练中的信用分配问题,通过预期效用转移和Shapley值实现公平奖励分配,实验显示其在SOTOPIA基准上达到新状态-of-the-art性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05437 2026-04-22 cs.CL 57%

Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models

一旦正确,仍错误:多语言视觉-语言模型中的反事实幻觉

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈姆丹·本·哈马德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨多语言视觉-语言模型在文化背景下反事实幻觉的问题,提出M²CQA基准测试,通过17个中东国家图像和多语言对比陈述评估模型性能,发现阿拉伯语尤其在方言中反事实幻觉率显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03108 2026-04-22 cs.CL 57%

ChemPro: A Progressive Chemistry Benchmark for Large Language Models

ChemPro:一种渐进式的化学基准测试用于大语言模型

Aaditya Baranwal, Shruti Vyas

机构 * Aaditya Baranwal Shruti Vyas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ChemPro通过4100个化学问题-答案对评估大语言模型在化学领域的表现,涵盖多个难度层级,揭示了LLM在科学推理中的局限性。

Comments Accepted at Artificial Intelligence Chemistry Journal

Journal ref Artif. Intell. Chem. 4(1), 100118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15907 2026-04-22 cs.CL 57%

TabReX : Tabular Referenceless eXplainable Evaluation

TabReX : 不依赖参考的表格可解释性评估

Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 TabReX 提出了一种不依赖参考的表格生成评估框架,通过图推理方法将源文本和生成表格转化为知识图谱,并计算可解释的评分,实现结构和事实的准确性评估。

Comments Accepted to ACL 2026 (Main Conference). Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 57%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18226 2026-04-21 cs.CL 57%

Model in Distress: Sentiment Analysis on French Synthetic Social Media

模型受挫:法语合成社交媒体上的情感分析

Pierre-Carl Langlais, Pavel Chizhov, Yannick Detrois, Carlos Rosas Hinostroza, Ivan P. Yamshchikov, Bastien Perroy

机构 * PleIAs RATP Group(RATP集团) CAIRO EPFL(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种通用合成数据生成管道,用于法语公共交通顾客 distress 检测,通过回译和合成推理轨迹生成170万条合成推文,训练出77-79%准确率的推理器,降低标注成本并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 57%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18158 2026-04-21 cs.AI 57%

State Transfer Reveals Reuse in Controlled Routing

状态转移揭示了受控路由中的重用

Yanzhen Lu, Zhicheng Qian, Muchen Jiang, Xingyu Zhou

机构 * Shanghai Qizhi Institute(上海启智研究院) Southeast University(东南大学) Nanjing Whale Cloud(南京 Whale 云) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过受控路由任务研究状态表示的位置,发现固定接口转移比可训练提示成功更有力地证明重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18038 2026-04-21 cs.CY cs.AI 57%

First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows

首先,不要伤害(与LLM一起):通过代理工作流减轻种族偏见

Sihao Xing, Zaur Gouliev

机构 * School of Enterprise Computing and Digital Transformation(企业计算与数字化转型学院) Technological University Dublin(都柏林技术大学) School of Information and Communication Studies(信息与传播研究学院) University College Dublin(都柏林大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究通过代理工作流评估医疗LLM中的种族偏见,发现DeepSeek V3在诊断任务中表现最佳,嵌入代理工作流后显著降低偏见指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17989 2026-04-21 cs.AI 57%

AIT Academy: Cultivating the Complete Agent with a Confucian Three-Domain Curriculum

AIT Academy:通过儒家三领域课程培养完整智能体

Jiaqi Li, Lvyang Zhang, Yang Zhao, Wen Lu, Lidong Zhai

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AIT Academy框架,通过儒家三领域课程培养完整智能体,实验显示多领域视角在安全意识校准中有诊断价值。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17972 2026-04-21 cs.CL 57%

Modeling Multiple Support Strategies within a Single Turn for Emotional Support Conversations

在单轮中建模多种支持策略用于情感支持对话

Jie Zhu, Huaixia Dou, Junhui Li, Lifan Guo, Feng Chen, Jinsong Su, Chi Zhang, Fang Kong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云Qwen团队) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在单轮中生成多策略回应的方法,通过All-in-One和One-by-One生成策略,结合强化学习提升策略选择和回应生成,实验证明多策略生成能提高情感支持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17894 2026-04-21 cs.CL 57%

Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language Instructions

基于用户定义动态模板和自然语言指令的自动幻灯片更新

Kun Zhou, Jiakai He, Wenmian Yang, Zhensheng Wang, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DynaSlide基准,结合多模态解析和自然语言指令,实现幻灯片动态更新,保留布局与样式,并设计评估协议揭示未来研究挑战。

Comments To appear in Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04043 2026-04-21 cs.CL 57%

When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life

当助手变成危险:一个多模态大语言模型在日常生活中的安全分析基准

Xinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Youwei Liao, Yixuan Wang, Xiangyu Shi, Fengran Mo, Su Yao, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学) Peking University(北京大学) University of Montreal(蒙特利尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SaLAD基准,通过2013个真实世界图像-文本样本评估多模态大语言模型在日常生活中的安全影响,揭示模型在识别危险行为方面的局限性。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15586 2026-04-21 cs.CL 57%

Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation

通过强化学习学习提取理性证据以增强检索增强生成

Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出EviOmni,通过推理先提取证据,结合证据推理与提取,利用强化学习优化生成质量,实验表明其在多个基准数据集上表现优异,提升下游任务准确率。

Comments 23 pages, 8 Figures, 18 Tables; Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17570 2026-04-21 cs.CV cs.AI 57%

PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。

Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17543 2026-04-21 cs.CL 57%

PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

PoliLegalLM:政治与法律领域大型语言模型的技术报告

Yuting Huang, Yinghao Hu, Qian Xiao, Wenlin Zhong, Yiquan Wu, Taishi Zhou, Moke Chen, Changlong Sun, Kun Kuang, Fei Wu

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17293 2026-04-21 cs.CL 57%

Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

超越“我不知道”:评估LLM在区分数据和模型不确定性中的自我意识

Jingyi Ren, Ante Wang, Yunghwei Lai, Xiaolong Wang, Linlu Gong, Weitao Li, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出UA-Bench基准测试,评估LLM在区分数据不确定性和模型不确定性方面的能力,发现即使先进模型也难以可靠区分,并提出轻量数据合成与强化学习策略提升不确定性判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17284 2026-04-21 cs.AI 57%

HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents

HalluClear:诊断、评估和缓解GUI代理中的幻觉

Chao Jin, Wenkui Yang, Hao Sun, Yuqi Liao, Qianyi Jiang, Kai Zhou, Jie Cao, Ran He, Huaibo Huang

机构 * MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所人工智能与自然语言处理实验室,中国科学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HalluClear通过引入专门的幻觉分类、校准的评估流程和闭环推理方案,有效减少GUI代理中的幻觉,提升自动化可靠性。

Comments 47 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22368 2026-04-21 cs.CV cs.AI 57%

When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations

当视觉不是问题:在误导性数据可视化上评估视觉-语言模型

Harsh Nishant Lalai, Raj Sanjay Shah, Hanspeter Pfister, Sashank Varma, Grace Guo

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度理工学院和科学学院,皮拉尼) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估视觉-语言模型在识别误导性数据可视化中的能力,发现模型在检测可视化设计错误上更可靠,但常误判非误导性可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21257 2026-04-21 cs.CL 57%

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01101 2026-04-21 cs.CL 57%

TSVer: A Benchmark for Fact Verification Against Time-Series Evidence

TSVer:一个针对时间序列证据的事实验证基准

Marek Strong, Andreas Vlachos

机构 * Department of Computer Science and Technology(计算机科学与技术系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TSVer基准,通过时间序列证据进行事实验证,包含304个真实声明和400个时间序列数据,采用LLM辅助标注提升质量,展示先进模型在时间序列推理上的挑战。

Comments Published at EMNLP 2025. v2 includes a revised version of the dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26278 2026-04-21 cs.CV cs.CL 57%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25944 2026-04-21 cs.AI 57%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL 57%

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01330 2026-04-21 cs.AI 57%

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks

NaturalGAIA:一个可验证的基准和分层框架用于长周期GUI任务

Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen

机构 * South China Normal University(华南师范大学) Zhejiang University(浙江大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出NaturalGAIA,通过真实人类GUI交互意图构建可验证评估数据集,结合LightManus-Jarvis框架,实现复杂自然任务的宏规划与微执行,实验显示其在路径成功率、token消耗和执行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17133 2026-04-21 cs.AI cs.CR 57%

If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data

若我的连续葡萄糖监测仪能说话:一个隐私保护的问答代理

Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CGM-Agent框架,通过本地计算实现隐私保护的连续葡萄糖数据问答,评估显示顶级模型在合成和现实查询中准确率分别为94%和88%。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17105 2026-04-21 cs.CL 57%

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them

词法化如何限制语言模型中语音知识的表示以及如何改进

Disen Liao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨词法化对文本模型语音知识表示的影响,提出STAD指标量化词法化偏差,并通过IPA基础微调方法提升语音相关任务性能。

Comments 18 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG 57%

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16753 2026-04-21 cs.AI 57%

Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs

何时信任技能:单智能体LLM的延迟评估与认知警惕

Eren Unlu

机构 * Globeholder Paris, France(巴黎Globeholder机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MESA-S框架,通过延迟评估和认知警惕机制提升单智能体LLM的可靠性,减少供应链漏洞并防止自信膨胀。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏