GS-QA: A Benchmark for Geospatial Question Answering
GS-QA:一个地理空间问答的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出GS-QA基准测试,用于评估地理空间问答系统,通过结合多个来源的信息,涵盖广泛的空间对象、谓词和答案类型,展示了现有方法在处理复杂空间谓词和多源推理时的局限性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
GS-QA:一个地理空间问答的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出GS-QA基准测试,用于评估地理空间问答系统,通过结合多个来源的信息,涵盖广泛的空间对象、谓词和答案类型,展示了现有方法在处理复杂空间谓词和多源推理时的局限性。
AgroTools: 一个用于农业中增强工具的多模态代理基准
机构 * Sun Yat-Sen University(中山大学) ; Southwest University(西南大学) ; Northeastern University(东北大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; Southwest Jiaotong University(西南交通大学) ; China Agricultural University(中国农业大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。
AEGIS:一个评估人工智能生成学术图像取证分析的综合基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出AEGIS基准,通过七个学术类别和39个细粒度子类型覆盖,揭示了人工智能生成学术图像取证分析的内在难度,同时评估了多种模型在检测、推理和定位方面的性能,揭示了不同模型家族的互补优势。
Comments Accepted to ACL 2026 Main Conference
COCOTree: 一个用于开放树状视觉分解的数据集和基准
机构 * Chung-Ang University(Chung-Ang大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出COCOTree数据集和基准,通过自动化生成管道和开放词汇空间,实现了对复杂物理组装的长尾分布的捕捉,并提出了Open Tree Quality (OTQ)评估指标。
Thermo-VL:扩展视觉语言模型以适应热红外感知
机构 * Department of Electrical & Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Thermo-VL,一种基于热红外感知的视觉语言模型,通过引入可训练的热编码器和文本引导的双注意力融合模块,提升了低光照条件下的多光谱融合能力,并在热红外和RGB+热红外推理任务中取得显著成果。
Comments 18 pages, 11 figures
Ablate-to-Validate: 视觉语言模型真的在使用连续思维令牌吗?
机构 * University of Washington(华盛顿大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种诊断原则Ablate-to-Validate,通过Token Replacement Test(TRT)测试视觉语言模型是否真正利用了连续令牌内容,发现模型性能提升可能并非源于令牌内容,而是令牌存在本身。
多智能体感知系统中的上下文引导领域适应
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种上下文引导的领域适应方法,通过多智能体系统中的用户修改来隐式指定领域知识,从而改进大语言模型驱动的多代理推理行为。
增强偏好优化用于推理增强的推荐
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。
增强大语言模型中的因果推理:一种用于精确微调的因果归因模型
机构 * University of California, Irvine(加州大学尔湾分校) ; North Carolina State University(北卡罗来纳州立大学) ; Amazon(亚马逊公司)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种因果归因模型,通过精确微调提升大语言模型的可解释性和因果推理能力,展示了模型在不同领域中的因果发现任务中的有效性。
Comments A Python implementation of our proposed method is available at https://github.com/ncsulsj/Causal_LLM
Pelican-Unify 1.0:一种用于理解和推理、想象和行动的统一具身智能模型
机构 * Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京人形机器人创新中心(X-Humanoid))
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出Pelican-Unify 1.0,一种基于统一原则训练的首个具身基础模型,通过单一视觉语言模型作为统一理解模块,将场景、指令、视觉上下文和行动历史映射到共享语义空间,并通过统一推理模块生成任务、行动和未来导向的思维链,最终将隐藏状态投影到密集潜在变量中,再通过统一未来生成器生成未来视频和行动。
Foresee-to-Ground: 从预测性时间感知到证据驱动推理的视频时间接地
机构 * Qwen3-VL-8B-Instruct
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出了一种新的视频时间接地框架F2G,通过将时间接地问题重新表述为可验证的识别-测量问题,结合预测性时间感知和证据驱动推理,以提高时间接地的准确性和鲁棒性。
Comments Accepted by ICML 2026
原子锚定的大语言模型:化学 retrosynthesis 的演示
机构 * Machine Learning Research(机器学习研究) ; Pfizer Research and Development(辉瑞研发) ; Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所) ; Leiden University(莱顿大学) ; Leiden Academic Centre for Drug Research(莱顿药物研究中心) ; Leiden Institute of Chemistry(莱顿化学研究所)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出了一种利用通用大语言模型进行分子推理的框架,通过原子标识符将链式推理与分子结构锚定,无需任务特定的模型训练,在单步 retrosynthesis 任务中实现了高成功率。
Comments Alan Kai Hassen and Andrius Bernatavicius contributed equally to this work
CacheClip: 通过有效的KV缓存重用加速RAG
机构 * Intel Corporation(英特尔公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CacheClip框架,通过有效利用KV缓存重用,解决了RAG系统中TTFT瓶颈问题,同时保持高质量生成。
Gated DeltaNet-2:解耦擦除与写入的线性注意力
机构 * NVIDIA
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出Gated DeltaNet-2,通过引入通道级擦除门和写入门,解耦了线性注意力中擦除与写入的控制,从而在语言模型、常识推理和检索任务中取得了最佳性能,特别是在长上下文检索任务中表现突出。
Comments Gated DeltaNet-2 technical report; code at https://github.com/NVlabs/GatedDeltaNet-2
FastTab: 一种快速表格识别器,结合了微小递归模块和1D变换器
机构 * LITIS
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出FastTab,一种基于网格的表格结构识别模型,通过轻量级的Tiny Recursive Module和轴向1D Transformer编码器,实现了高效的表格结构恢复,同时在多个基准测试中表现出低延迟和良好的鲁棒性。
SciCore-Mol: 通过可插拔分子认知模块增强大语言模型
机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) ; Tsinghua University, Beijing, China(清华大学,北京) ; School of Intelligence Science and Technology, Nanjing University, Suzhou, China(智能科学与技术学院,南京大学苏州校区)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出SciCore-Mol框架,通过三个深度集成的可插拔认知模块解决大语言模型处理异构科学数据(如分子)时的语义鸿沟问题,实现分子理解、生成、反应预测和化学知识的综合性能提升。
Comments 15 pages, 4 figures, 9 tables. Preprint
MuKV:多粒度KV缓存压缩用于长流视频问答
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出MuKV,一种多粒度KV缓存压缩方法,通过半分层检索方法提升长流视频问答的效率和准确性,实验表明其在答案准确率、内存使用和在线问答效率方面均优于基线方法。
Comments To appear at CVPR'26. Code is available at https://github.com/IMBALDY/MuKV
ExComm:探索阶段通信用于容错的代理测试时间扩展
机构 * KAIST(韩国科学技术院) ; Amazon AGI(亚马逊人工智能实验室) ; Together AI
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ExComm,一种用于探索阶段的代理测试时间扩展通信协议,通过定期审计代理信念状态以检测跨代理事实冲突,并通过专用工具验证循环解决冲突,从而提升测试时间扩展的容错能力。
Not Yet: 人类在布洛托 tournaments 中优于 LLMs
机构 * HSE University(俄罗斯高等经济学院) ; New Economic School(新经济学校) ; Central Economic Mathematical Institute, Russian Academy of Sciences(俄罗斯科学院中央经济数学研究所) ; Adyghe State University(阿迪格国立大学) ; Moscow Institute of Physics and Technology(莫斯科物理技术学院) ; Innopolis University(因诺波利斯大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究通过布洛托博弈 tournaments 比较了人类与 LLMs 的策略表现,发现人类更擅长使用校准良好的中间层次分配启发式方法,而 LLMs 的简单策略表现较差。
SCI-Defense: 防御生成引擎优化的操纵攻击
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学与数据科学学院) ; School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院) ; Amazon topcited.ai(亚马逊topcited.ai)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出SCI-Defense框架,通过检测困惑度、语义完整性评分和跨候选检测三种组件,有效识别生成引擎优化攻击,实现了高精度和低误报率,同时揭示了现有防御方法的局限性及未来研究方向。
Comments 20 pages, NeurIPS 2026 submission
将信号转换为语言以实现基于sEMG的活动识别
机构 * Lancaster University(兰卡斯特大学) ; Monash University(墨尔本大学) ; Cardiff University(卡迪夫大学)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出了一种基于大语言模型的sEMG活动识别框架,通过将连续sEMG信号转换为语言形式,提升活动识别的准确性。
大语言模型中的在线自蒸馏简要概述:On-Policy Self-Distillation
专题命中 其他推理 :reasoning(abstract)
AI总结 本文探讨了在线自蒸馏(OPSD)在大语言模型中的应用,提出了一种统一的学习框架,使单个大语言模型同时扮演教师和学生角色,通过减少每个token的分布分歧来对齐推理行为,从而提高效率并减少GPU内存消耗。
EvoVid: 以时间为中心的自我进化用于视频大语言模型
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ; ByteDance(字节跳动)
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出EvoVid,一种以时间为中心的自我进化框架,使视频大语言模型能够直接从未经标注的视频中改进。通过引入两个互补的时间感知奖励,即时间感知的问题生成奖励和时间基础的求解奖励,EvoVid在四个基础模型和六个基准测试中实现了优于基线模型和现有自我进化基线的改进,展示了时间为中心的自我进化在视频理解和推理中的有效性。
Comments Project page: https://huangshiqi128.github.io/EvoVid.io/
利用大型语言模型生成恶意软件规避规则以应对分析沙箱中的规避行为
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出了一种基于大型语言模型的方法,用于自动生成绕过沙箱环境中的恶意软件规避检查的YARA规则,通过分析恶意软件的执行轨迹并采用多种推理策略生成针对性的绕过规则,最终在多个真实恶意软件样本上实现了79%的绕过成功率。