Learning from Reasoning Failures via Synthetic Data Generation
通过合成数据生成学习推理失败
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过合成数据生成学习推理失败
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。
评估大型语言模型的会计推理能力
机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文评估了大型语言模型在会计推理任务中的能力,通过定义垂直领域会计推理标准,分析了GLM和GPT-4等模型的表现,发现提示设计对性能影响显著,但现有模型仍需优化以满足实际需求。
PCoKG:具有辩论机制的个性感知常识推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 PCoKG通过引入辩论机制构建个性感知常识知识图谱,提升对话生成的一致性与个性化水平。
Comments Accept by AAAI-2026
ReasonTabQA: 一个全面的表格问题回答基准,用于现实世界工业场景
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) ; Chongqing University(重庆大学) ; Beihang University(北京航空航天大学)
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 ReasonTabQA是一个针对现实工业场景的表格问题回答基准,通过引入TabCodeRL强化学习方法提升模型推理能力,揭示了工业级表格问答的复杂性。
BnMMLU:测量孟加拉语大规模多任务语言理解
机构 * University of Malaya(马来大学) ; BRAC University(BRAC大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 BnMMLU通过大规模多任务评估孟加拉语语言理解,揭示模型推理和应用能力的不足,并推动多语言NLP发展。
Comments 19 Pages, 10 Tables, 12 Figures
CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。
Comments 12 pages
MLB:面向临床应用的大型语言模型评估场景驱动基准
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Health Information Center of Zhejiang Province(浙江省健康信息中心) ; Peking University(北京大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。
Comments 11 pages, 4 figures, 5 tables
大规模多模态基准的判断模型
机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。
从对齐到提升:通过合成数据 bootstrap 音频-语言对齐
机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。
Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa
Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025
GRPO与状态突变:改进基于LLM的硬件测试计划生成
机构 * Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院电子工程与计算机科学系) ; NVIDIA Research, Austin, TX(NVIDIA研究部) ; NVIDIA Research, Taiwan(NVIDIA台湾研究部) ; NVIDIA Research, Santa Clara, CA(NVIDIA圣克拉拉研究部)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 GRPO-SMu通过改进LLM训练方法,显著提升硬件验证中测试计划生成的准确率和突变检测率。
BEAT-Net:注入生物仿生时空先验以实现可解释的ECG分类
机构 * School of Information Technology(信息科技学院) ; Monash University Malaysia(墨尔本大学马来西亚分校) ; Faculty of Biomedical Engineering(生物医学工程学院) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 BEAT-Net通过生物仿生时空先验实现ECG分类的可解释性与高效性
Comments 8 pages, 4 figures and 2 tables
Relink:为GraphRAG构建查询驱动的证据图谱
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。
Comments Accepted by AAAI 2026
大语言模型能否理解、推理并生成混合语言文本?
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过CodeMixQA基准测试评估大语言模型在理解、推理和生成混合语言文本方面的能力,揭示了模型在混合语言环境中的局限性,并提供了改进多语言LLMs的见解。
Comments Preprint
mind_call: 一个用于大语言模型心理健康新功能调用的数据集
机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。
医疗多模态大语言模型的视点临床意图理解能力基准测试
机构 * Shenzhen University(深圳大学) ; Stanford University(斯坦福大学) ; City University of Hong Kong(香港城市大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。
Comments 16 pages, 4 figures
MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应
机构 * Stanford University(斯坦福大学) ; Xi’an Jiaotong University(西安交通大学) ; Shenzhen University(深圳大学) ; Renmin University of China(中国人民大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。
Comments 19 pages, 7 figures
PromptPort:跨模型结构提取的可靠性层
专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 PromptPort通过结合确定性规范化与轻量级验证器和安全覆盖策略,解决跨模型结构提取中的格式坍塌问题,提升输出可靠性与语义能力。
Comments 12 pages, 4 figures
SALT-KG:一个面向企业表格的语义感知学习基准
机构 * SAP SE(SAP股份有限公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 SALT-KG是一个面向企业表格的语义感知学习基准,通过链接元数据知识图与多表事务数据,评估模型在表格证据和上下文语义上推理的能力。
随机CHAOS:为何确定性推断会杀死,而分布性变化是人工认知的心跳
机构 * Raapid Lab, USA(美国Raapid实验室) ; Apple, USA(美国苹果公司) ; Google, USA(美国谷歌公司) ; Pragya Lab, BITS Pilani Goa, India(印度BITS Pilani Goa大学Pragya实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文主张随机CHAOS,认为确定性推断会压制LLM的不确定性建模和安全对齐,强调分布性变化对人工认知的重要性。
对抗提示攻击的防御学习表面启发式
机构 * University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Amazon(亚马逊公司) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了对抗提示攻击防御中表面启发式的问题,发现现有方法易受表面模式影响,提出受控数据集和系统评估以揭示监督微调的局限性。
Zer0n:一种结合人工智能的漏洞发现与区块链保障完整性框架
机构 * Parul University(帕鲁大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 Zer0n通过结合AI与区块链技术,实现高效漏洞检测与完整性保障,达到80%的准确率并保持低开销。
Comments 10 pages, 3 figures, 7 tables. Framework for AI-Assisted Vulnerability Discovery
SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准
机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。
Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices
LongEmotion: 测量大语言模型在长上下文交互中的情感智能
机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) ; The University of Hong Kong(香港大学) ; City University of Hong Kong(香港城市大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Beijing Normal University(北京师范大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。
Comments Technical Report
内在记忆代理:通过结构化上下文记忆实现异构多代理LLM系统
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; King’s College London(伦敦大学国王学院) ; University of Southampton(南安普顿大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 本文提出内在记忆代理,通过结构化上下文记忆提升多代理LLM系统在复杂任务中的表现,展现更高的设计质量和一致性。
基于代理AI的意图驱动网络用于6G
机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) ; Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。
Comments Submitted for Possible Journal Publication
在气泡中编码?评估LLMs在代码适应过程中解决上下文适应故障的能力
机构 * National University of Defense Technology(国防科技大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究提出CtxBugGen框架,评估LLMs在解决代码适应中的上下文适应故障方面的性能,发现LLMs在处理此类问题时存在显著不足。
Comments 24 pages, 11 figures, accepted by FSE 2026
PriceSeer:实时股票预测中大型语言模型的评估
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。
Comments 7 pages, 6 figures
Operation Veja: 修复现代角色扮演训练范式中缺失的根本概念
机构 * Divergence 2% LLC ; Department of Electrical and Computer Engineering University of Illinois Urbana-Champaign(电气与计算机工程系伊利诺伊大学厄巴纳-香槟分校) ; Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 Operation Veja提出VEJA框架,通过整合价值观、经历、判断和能力,改进角色扮演模型的数据整理方法,以提升角色真实性和叙述连续性。
Comments Accepted to NeurIPS 2025 PeronaLLM workshop
迈向更安全的AI审核:通过统一基准数据集评估LLM审核员并倡导以人类为中心的方法
机构 * Fordham University(福特汉姆大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文通过统一基准数据集评估LLM审核性能,提出SafePhi在道德判断上优于现有模型,强调需引入人类反馈提升审核可靠性。
KG-MuLQA:基于知识图谱的多级问答提取与长上下文LLM评估框架
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 KG-MuLQA通过基于知识图谱的文档表示,实现了多级问答提取与长上下文LLM评估,揭示了模型在集合运算和多跳推理上的系统性失败模式。