The Table Says Otherwise: Testing LLMs with Counterfactual Relational Data
表格另有说法:用反事实关系数据测试大语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
表格另有说法:用反事实关系数据测试大语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。
LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估
专题命中 推理评测 :reasoning(abstract)
AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。
Comments Accepted by KDD 2026
零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Magna International(麦格纳国际)
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。
Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026
评估语言模型在显著类识别中的表现
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 研究语言模型能否直接从代码提交中识别显著类,无需特征工程或图构建,发现小模型在少样本提示下性能接近大模型,可降低成本和隐私障碍。
Comments 22 pages, 1 images, 8 tables, Manuscript submitted to a Journal (2026)
MalSkillBench: 一个运行时验证的恶意智能体技能基准
专题命中 推理评测 :reasoning(abstract)
AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
专题命中 推理评测 :reasoning(abstract)
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026
探索ChatGPT在实验物理反馈与评估中的潜力
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探索ChatGPT在实验物理实验报告评估中的应用,通过API评估和定制化ChatGPT两种模式,发现其在形式结构反馈上表现一致,但在技术推理和实验数据解释方面可靠性较低,强调了教师监督的重要性。
Comments 11 pages, 1 fig
CodePercept: 基于代码的MLLM视觉STEM感知
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) ; Qwen Team(通义实验室) ; Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。
Comments Accepted by CVPR2026
MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。
推理模型能否检测其思维链的变化?
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究推理模型在多种条件下检测自身思维链干预的能力,发现模型检测准确率很低,且难以识别修改方式。
CFPO:用于多模态推理的反事实策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。
Comments Accepted to ICML 2026. 17 pages
语言模型中的伪 deliberation:当推理无法使价值观与行动一致时
机构 * New York University(纽约大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。
Comments 9 pages, 5 main figures
通过内化学习
机构 * New York University(纽约大学) ; Toyota Technological Institute at Chicago(丰田芝加哥技术研究所) ; University of Chicago(芝加哥大学)
专题命中 其他推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG
AI总结 研究神经网络系统通过将显式计算过程吸收到自身权重中的内化机制,分析变换器如何内化半自动机模拟及链式思维令牌,首次证明简化单层变换器在奇偶性学习任务中成功内化的过程。
Comments first version, 43 pages
言行不一:大型语言模型中的指令诱导冲突
机构 * Future Impact Group(未来影响组)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大型语言模型在面对指令与模式完成之间的冲突时的表现,发现指令遵循率在不同模型和指令下差异显著,输出多样性是预测鲁棒性的主要因素。
Comments 31 pages
PRIDE: 特权信息增强的共情对话生成蒸馏方法
机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。
结构化超边适应用于视觉Transformer的参数高效微调
机构 * Griffith University(格里菲斯大学) ; Data61/CSIRO(Data61/澳大利亚联邦科学与工业研究组织)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出HyperAdapter,一种基于超图的适配器架构,通过软超边路由实现结构化、组感知的适应,在参数预算下优于现有PEFT方法。
Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)
引导而非求解:为大型代码智能体训练小型评论模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对代码智能体策略推理不足的问题,提出冻结智能体并训练小型评论模型提供轨迹内反馈,在SWE-bench Verified上提升准确率并降低成本。
最优Token基线:长程LLM-RL的方差缩减
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学) ; Hong Kong University of Science(香港科学大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Vector Institute(向量研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对长程LLM-RL训练中梯度方差爆炸问题,从第一性原理推导最优Token基线,提出仅用前向概率近似梯度范数的Logit-Gradient Proxy,以N=4分组达到N=32性能,减少65%以上Token消耗。
人类与AI协作进行肺结节分割
机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) ; PET/CT Center, The First Affiliated Hospital of Guangzhou Medical University(广州医科大学第一附属医院PET/CT中心) ; Department of Thoracic Surgery and Oncology, The First Affiliated Hospital of Guangzhou Medical University(广州医科大学第一附属医院胸外科与肿瘤科) ; Department of Mathematical Science, Tsinghua University(清华大学数学科学系) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学尤金数学科学中心) ; China State Key Laboratory of Respiratory Disease & National Clinical Research Centre for Respiratory Disease, Guangzhou, China(中国呼吸疾病国家重点实验室及呼吸疾病临床研究中心,广州,中国) ; School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) ; National Center for Respiratory Medicine, National Clinical Research Center for Respiratory Disease, Guangzhou Institute of Respiratory Health, The First Affiliated Hospital of Guangzhou Medical University(呼吸医学国家中心、呼吸疾病临床研究中心、广州呼吸健康研究院、广州医科大学第一附属医院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 提出Hi-Seg框架,基于SAM通过人类迭代优化提示实现肺结节分割,在12中心1179例CT上平均Dice达85%,优于多种深度学习模型,并降低标注时间。
TraceView: 智能体程序修复轨迹的交互式可视化
机构 * Belmont University(贝尔蒙特大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 提出TraceView工具,通过交互式可视化和语义关系标注,帮助开发者诊断LLM-based自动程序修复代理的失败原因,支持轨迹扫描与理解。
CNnotator: LLM引导的内存安全注释合成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Galois, Inc.(Galois公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。
Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version
Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages
上下文感知的生成式AI用于自动化电信测试脚本生成
机构 * Ericsson R&D Bangalore(爱立信印度班加罗尔研发中心)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 提出一种上下文感知的生成式AI框架,通过实时知识图谱和增量引擎检测变化,仅更新受影响的测试,减少人工并加速测试周期。
基于LLM概念化的事件本体扩展
机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 提出ConceptE框架,利用LLM从句子和触发词中提取概念级语义,增强事件聚类和层次扩展,在ACE、ERE和MAVEN上显著优于现有方法。
UniSLAD: 面向结构与逻辑工业视觉异常检测的统一框架
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 提出UniSLAD统一框架,无需额外训练即可同时检测结构异常和逻辑异常,通过双特征提取器与双粒度特征表示模块,在工业基准上实现99.4%和93.1%的检测性能。
Comments This work has been accepted for publication in the Proceedings of the 2026 IEEE International Conference on Automation Science and Engineering (CASE)
LLM即代码:面向Agent框架的编程范式
机构 * City University of Hong Kong(香港城市大学) ; Tencent Jarvis Lab(腾讯贾维斯实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。
Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)
缓解多图像理解中大型视觉语言模型的跨图像信息泄露
机构 * Sogang University(ソガン大学) ; Princeton University(普林斯顿大学) ; NAVER AI Lab(NAVER AI实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 针对大型视觉语言模型在多图像输入时性能下降的问题,提出无需训练且架构无关的FOCUS方法,通过随机噪声掩码和噪声参考输入抑制跨图像信息泄露,显著提升多图像和视频理解性能。
Comments Source code is available at https://github.com/yejipark-m/FOCUS
CAAD:对比音频感知蒸馏用于高效语音语言模型
专题命中 其他推理 :reasoning(abstract)
AI总结 提出对比音频感知蒸馏(CAAD)框架,通过同步教师强制策略将教师模型的对比推理内化到学生模型权重中,在Dynamic-SUPERB上相对提升约8%,并减少语言偏倚。
Comments Accepted to interspeech 2026
浴火重生:自主AI如何解锁网络安全挑战
专题命中 其他推理 :reasoning(abstract)
AI总结 本文探讨自主AI通过直接处理自然语言或代码来缓解安全防御中劳动密集型瓶颈的潜力,并通过16个案例研究(包括供应链分析)展示其对防御者的益处。
Comments two tables, under submission
生成式AI自适应预测试的收益是否持久?来自一项保持研究的数据
专题命中 其他推理 :reasoning(abstract)
AI总结 研究通过七周保持期实验,发现GenAI自适应预测试能提升初始理解,但持续学习依赖于后续AI支持练习的结构化方式。
Comments 27th International Conference on AI in Education
调查现代AI和云基础设施的安全性
专题命中 其他推理 :reasoning(abstract)
AI总结 本文通过物理内存共置到远程服务接口的交互层次分类法,系统解构AI和现代云基础设施的安全假设,并展示利用各抽象层假设的实际攻击。
Comments PhD thesis