Self-MedRAG: a Self-Reflective Hybrid Retrieval-Augmented Generation Framework for Reliable Medical Question Answering
Self-MedRAG:一种用于可靠医学问答的自反思混合检索增强生成框架
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Self-MedRAG通过混合检索与自反思机制提升医学问答的准确性和可靠性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Self-MedRAG:一种用于可靠医学问答的自反思混合检索增强生成框架
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Self-MedRAG通过混合检索与自反思机制提升医学问答的准确性和可靠性。
利用大语言模型检测协作学习中的社会共享调节
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Vanderbilt University(范德堡大学) ; University of Detroit Mercy(底特律默克大学) ; New York University(纽约大学)
专题命中 复杂问题求解 :planning(abstract);分类 cs.LG
AI总结 本文利用大语言模型检测协作学习中的社会共享调节行为,通过嵌入方法提升学习分析的预测能力。
Comments Short research paper accepted at Learning Analytics and Knowledge (LAK '26)
链式净化思维:在大推理模型的CoT中消除PII泄露
专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出PII-CoT-Bench,通过部署干预措施减少大推理模型中链式思维推理的PII泄露,证明隐私优先推理可在不牺牲性能的情况下实现。
Comments 12 pages, 6 figures, 1 table
认知-心理-大语言模型:通过在线文本评估大语言模型在心理健康预测中的推理能力
机构 * Ira A. Fulton Schools of Engineering Arizona State University Tempe, USA(伊拉·A·福林工程学校亚利桑那州立大学Tempe分校) ; Department of Psychology Santa Clara University Santa Clara, USA(心理学系圣克拉拉大学Santa Clara分校)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过评估链式思维等推理技术,改进了大语言模型在心理健康预测中的分类性能,发现推理增强技术在复杂案例中表现更优,但存在数据集特定的限制。
Comments 8 pages, 4 Figures, 3 tables
ThinkDrive: 基于链式推理的渐进强化学习微调框架用于自动驾驶
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 ThinkDrive通过结合显式推理与难度感知的自适应策略优化,提升了自动驾驶中的决策透明度和泛化能力,实验显示其在多个指标上优于现有方法。
PILOT-Bench:一个以专利领域法律推理为核心的基准,包含与IRAC对齐的分类任务
机构 * Pukyong National University(浦项国立大学) ; Tomocube Inc.(Tomocube公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 PILOT-Bench通过IRAC对齐的分类任务评估专利领域法律推理能力,揭示闭源与开源模型在推理性能上的显著差异。
Comments Accepted at the NLLP Workshop at EMNLP 2025
Sci-Reasoning:一个解码AI创新模式的数据集
机构 * Orchestra Research(Orchestra研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 Sci-Reasoning数据集通过分析AI研究中的15种思维模式,揭示了高影响力论文的创新机制,为训练下一代AI研究代理提供结构化推理轨迹。
Comments 22 pages, 9 figures
几何推理的里程碑:通过子目标可验证奖励解锁几何推理
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology Beijing(北京科技大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。
在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理
机构 * Roche(罗氏) ; Accenture(埃森哲) ; Involead
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。
Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review
GeM-VG:迈向通用多图像视觉 grounding 的多模态大语言模型
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 GeM-VG通过引入MG-Data-240K数据集和混合强化微调策略,提升多图像视觉 grounding 和通用多图像理解能力。
PsychEval: 一个多会话和多疗法的基准,用于高真实感的AI心理顾问
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 PsychEval是一个多会话和多疗法的基准,用于评估高真实感的AI心理顾问,通过多阶段数据集和全面评估框架提升AI在心理咨询服务中的表现。
集成大语言模型的自动仇恨言论识别方法:使用可控文本生成模型
机构 * The University of Osaka(大阪大学) ; Ritsumeikan University(立命馆大学)
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型和可控文本生成模型,通过课程学习逐步训练以提高仇恨言论识别的准确率和效率。
Comments In Proceedings of the 17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC 2025)
TeleTables: 电信表格解释中的大语言模型基准
机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。
V-FAT:基于文本偏见的视觉真实性基准测试
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Meituan(美团) ; University of Oxford(牛津大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。
Comments 12 pages, 6 figures
LPFQA: 一个基于长尾专业论坛的LLM评估基准
机构 * ByteDance Seed Peking University(字节跳动种子北京大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。
阿拉伯提示与英语工具:一个基准
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出首个阿拉伯语言LLMs工具调用能力评估基准,揭示阿拉伯语交互环境下工具调用准确率下降5-10%的显著差距。
Comments 10 pages, 10 figures, LLMs, Big Data, and Multilinguality for All (LLMs4All) Workshop at IEEE BigData 2025 Conference, Macau, December 10, 2025
对大型语言模型在表格扭曲下的鲁棒性进行实证研究
机构 * Microsoft Corp.(微软公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究探讨了大型语言模型在表格数据扭曲下的鲁棒性问题,发现模型在缺乏显式提示时难以自动纠正表格错误,且顶级模型在扭曲下准确率显著下降。
Comments 4 pages, 1 figure, 1 table
具有注入情感归因思维的统一口语语言模型用于人样交互
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。
DVD:一种检测大规模语言模型评估中变体污染的稳健方法
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。
弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析
机构 * Okestro
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。
对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化
机构 * York University(约克大学) ; Salesforce AI Research(Salesforce人工智能研究) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。
Comments Accepted to EACL Main Conference
AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准
机构 * College of Computer Science and Technology(计算机科学与技术学院) ; National University of Defense and Technology(国防科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。
Comments 13 pages, 7 figures, Accepted by ASE 2025
大语言模型擦除方法的比较分析:跨架构评估
机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。
Comments 25 pages, 6 figures, 8 tables
FinDeepForecast:一个用于在金融预测中基准测试深度研究代理的实时多智能体系统
专题命中 推理评测 :reasoning(abstract)
AI总结 FinDeepForecast是一个实时多智能体系统,用于评估深度研究代理在金融预测中的表现,通过生成研究导向的金融预测任务,提供了一个公开的基准测试平台。
使用 Copilot Agent 模式自动化库迁移:一项定量评估
专题命中 推理评测 :planning(abstract)
AI总结 本文通过 Copilot Agent 模式评估了 SQLAlchemy 库迁移的自动化效果,发现其在功能迁移上表现良好但应用功能维护不足。
Comments Accepted at 1st International Workshop on Agentic Engineering (AGENT 2026, colocated with ICSE), pages 1-5
高阶知识表示用于代理科学推理
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于超图的知识表示方法,用于代理科学推理,通过高阶路径生成机理假设,提升科学发现效率。
模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏
机构 * School of Philosophy, Anhui University(安徽大学哲学学院) ; Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) ; Faculty of Education, University of Cambridge(剑桥大学教育学院) ; School of Foreign Studies, South China Normal University(华南师范大学外语学院) ; Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。
Comments 7 pages, 7 figures
TCAndon-Router: 多智能体协作的自适应推理路由
机构 * Tencent Cloud Andon(腾讯云安顿)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 TCAndon-Router通过动态智能体接入和自然语言推理链提升多智能体协作的路由准确性与鲁棒性。
Comments 16 pages, 6 figures. Under review at IJCAI
当前智能体无法利用世界模型作为前瞻性工具
机构 * UIUC(伊利诺伊大学香槟分校) ; THU(清华大学) ; JHU(约翰霍普金斯大学) ; Columbia(哥伦比亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。
Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)
文本作为通用的可转移个性化接口
机构 * Software College, Northeastern University(东北大学软件学院) ; Ant Group(蚂蚁集团) ; Ant International(蚂蚁国际) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学商学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用自然语言作为通用接口,通过两阶段训练框架开发出可转移的偏好推理模型,实现在多个任务和模型家族中的高性能表现。