Data and Evaluation Closed-Loop for Model Capability Enhancement
数据与评估闭环用于模型能力增强
机构 * Baidu Inc.(百度公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出“能力切片”单元,构建评估-数据闭环,将基准失败转化为可验证的数据干预,在两项案例中分别排除和确认数据问题。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
数据与评估闭环用于模型能力增强
机构 * Baidu Inc.(百度公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出“能力切片”单元,构建评估-数据闭环,将基准失败转化为可验证的数据干预,在两项案例中分别排除和确认数据问题。
迈向人类水平的书籍写作能力
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种用于大规模创意写作的 dataset 构建和训练框架,通过将监督微调重新定义为提示到书籍生成任务,以人类创作的虚构作品为基础,旨在提升生成文本的文学性。
Comments 72 pages, 13 figures, 9 tables
SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; Google(谷歌)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。
Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/
人类恶意的回声在智能体中:为多轮在线骚扰攻击评估LLMs
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 本文提出一个多轮在线骚扰攻击基准测试,通过合成数据集、多智能体模拟和三种 jailbreak 方法评估LLMs在多轮交互中的安全性,发现jailbreak调优显著提高攻击成功率,揭示了智能体在多轮对话中模仿人类攻击模式的弱点。
Comments 13 pages, 4 figures
大型语言模型及其有限的心智理论:评估情境对话中的心智状态标注
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出一个两阶段框架,利用大型语言模型作为团队对话的人类风格标注器和自动差异检测器,评估共享心智模型的连贯性。
Comments Published at The 27th Meeting of the ACL Special Interest Group on Discourse and Dialogue 2026
StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; East China University of Science and Technology(华东理工大学) ; Singapore Management University(新加坡管理大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。
Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo
SADL:该忽略什么?面向主体感知的干扰物定位基准
机构 * University of Science(科学大学) ; Vietnam National University Ho Chi Minh City(越南胡志明市国家大学) ; University of Information Technology(信息技术大学) ; John Von Neumann Institute(约翰·冯·诺依曼研究所)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SADL基准,包含1,800个主体感知案例,用于评估视觉语言模型在干扰物定位中的排除校准能力,揭示模型过度排除的问题。
面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 推理评测 :reasoning(abstract)
AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。
Pointer-CAD v2: 先规划后构建的尺寸感知参数化CAD生成
机构 * The University of Hong Kong(香港大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; TranscEngram ; Monash University(墨尔本大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出Pointer-CAD v2,采用先规划后构建范式,通过指针机制直接预测连续参数值,消除量化误差,并在顶点、边和面层级引入层次化几何精度指标,显著提升CAD生成的几何精度。
Comments Accepted to ECCV 2026. Code is available at https://github.com/Snitro/Pointer-CAD-v2
BackTranslation2.0——一种基于语言学的评估手语生成质量的指标
机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出BackTranslation2.0,一种基于语言学的文本到手语翻译评估指标,通过代理框架整合多个工具评估语法、音韵、流畅性和保真度,与人类判断高度相关。
Comments Accepted at ECCV 2026
基于LLM的知识图谱方法实现医疗器械监管合规自动化
专题命中 推理评测 :reasoning(abstract)
AI总结 提出结合知识图谱与大语言模型的方法,从FDA文档提取监管知识并自动分类医疗器械,实现合规评估自动化,减少人工审查并加速上市。
Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025, pp. 321-328
一致但错误:空间视觉-语言模型中的证据不敏感性
机构 * The University of Tokyo, Japan(东京大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 通过引入ViewDiag多视图评估协议,发现现代视觉-语言模型在空间推理中表现出跨视角一致但错误的现象,表明其预测主要源于先验驱动而非证据敏感推理。
X-Stream: 探索多模态大语言模型作为多流理解的多路复用器
机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) ; Huawei Inc.(华为公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。
Comments Project Page: https://peiwensun2000.github.io/xstream/
在物理教育中使用大型语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究评估了2024年中至2025年底发布的前沿大型语言模型在解决大学物理问题(经典力学、电磁学、量子力学)和自动评分方面的能力,发现文本推理接近饱和,多模态集成解决了空间几何限制,但部分评分仍存在挑战。
Comments 22 pages
重新定义质量标准与距离感知评分建模用于图像编辑评估
机构 * Northwestern Polytechnical University(西北工业大学) ; Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820
EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除
机构 * OGQ ; Seoul National University(首尔大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。
Comments Accepted to ECCV 2026
在视频生成模型中评估牛顿力学
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Morpheus框架,通过真实物理系统评估视频生成模型对牛顿力学的理解能力,揭示当前模型在物理原理编码上的不足。
Comments Forty-Third International Conference on Machine Learning (ICML 2026)
提示注入作为角色混淆
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过角色探测和CoT伪造攻击,揭示提示注入源于LLM对文本来源的角色感知混淆,并提出角色混淆程度可预测攻击成功率。
Comments ICML 2026
TAR:基于时间锚的视频时间定位推理
机构 * South China University of Technology(华南理工大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Bytedance Inc.(字节跳动有限公司)
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
AI总结 TAR通过引入时间锚机制,提升视频时间定位任务中推理过程的可信度和自主性,采用自举方法生成高质量推理轨迹,实现更精确的最终预测。
Comments Accepted by ECCV2026
辩论者混合:在多智能体推理中实现架构级别的辩论学习
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。
RADIANT-PET:结合大语言模型和强化学习的推理增强型PET/CT病灶分割
机构 * Division of Hematology, The Ohio State University Comprehensive Cancer Center(血液科,俄亥俄州立大学综合癌症中心) ; Department of Radiology, Mahidol University(医学放射科,玛希多大学) ; Department of Radiology, Mettapracharak Hospital(医学放射科,Mettapracharak医院) ; Department of Radiation Oncology, The Ohio State University Comprehensive Cancer Center(放射肿瘤科,俄亥俄州立大学综合癌症中心)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出RADIANT-PET框架,通过大语言模型和强化学习对候选摄取区域进行推理分类,抑制生理性假阳性,提升PET/CT病灶分割准确性。
通过近未来指导桥接在线策略蒸馏中的推理轨迹
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对在线策略蒸馏中令牌级学习信号无法有效桥接推理轨迹的问题,提出基于近未来轨迹信息的轨迹感知在线策略蒸馏方法,显著提升大语言模型推理性能。
CCRC:面向图像变化描述与分割的变化感知描述与推理链
机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) ; Guangxi Minzu University, China(广西民族大学,中国) ; National University of Defense Technology, China(国防科学技术大学,中国)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。
看见、思考、学习:一种自教的多模态推理器
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出See-Think-Learn框架,通过自训练提升多模态推理能力,结合感知与推理生成结构化推理过程,增强模型区分正确与误导性回答的能力。
Comments Accepted at The Winter Conference on Applications of Computer Vision 2026
强化微调自然缓解持续训练中的遗忘
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文比较了监督微调与强化微调在持续训练中的影响,发现强化微调能有效保留先验知识,优于监督微调和多任务训练,且在标准基准上提升模型通用知识。
临床证据强度可从语言模型表示中恢复,但无法从其陈述的等级中恢复
机构 * Lab for AI in Medicine(医学人工智能实验室) ; RWTH Aachen University(亚琛工业大学) ; University Hospital RWTH Aachen(亚琛大学医院) ; Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过构建临床声明数据集,测试22个开源大语言模型,发现模型内部表示可编码证据强度(中位AUROC 71.8%),但模型陈述的等级接近随机(低于估计器25-27个百分点),且该信号主要来自词汇特征,不随规模提升。
情境感知:通向超级人工智能的必要基础
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出情境感知(situation perception)是通向超级人工智能的关键缺失能力,包括抽象预测、长期压缩记忆和目标驱动的主动学习,并分析了当前大语言模型的不足及相应测试方法。
多表问答的潜在桥梁
机构 * EURECOM ; University of Antwerp(安特卫普大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出GRAB管道,通过图编码器和潜在桥梁将关系数据转化为紧凑表示,冻结LLM以保持推理能力,在多表问答中显著提升性能。
本体引导的反向思维使大语言模型在知识图谱问答中更强
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Joint Laboratory of HIT and iFLYTEK(哈工大与科大讯飞联合实验室) ; University of Science and Technology of China(中国科学技术大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Ontology-Guided Reverse Thinking框架,通过反向推理构建路径,提升大语言模型在知识图谱问答中的表现,实验表明其在WebQSP和CWQ数据集上达到最佳性能。
Comments We now public our source codes
基于Token共现图的高效检索增强生成
机构 * Università Politecnica delle Marche(波尔蒂纳拉理工大学) ; Università di Modena e Reggio Emilia(摩德纳和雷焦艾米利亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 提出TIGRAG框架,利用滑动窗口共现统计构建Token共现知识图谱,结合图语义扩展和神经重排序实现多跳推理,在三个QA基准上优于稠密检索和图RAG方法,同时降低索引和推理开销。