Spatial Audio Question Answering and Reasoning on Dynamic Source Movements
空间音频问答与动态声源运动推理
机构 * Qualcomm Technologies Inc.(高通技术公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
空间音频问答与动态声源运动推理
机构 * Qualcomm Technologies Inc.(高通技术公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。
Earth AI:利用基础模型和跨模态推理解锁地理空间洞察
机构 * Google Research(谷歌研究) ; Google X(谷歌X) ; Google Cloud(谷歌云)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 Earth AI通过基础模型和跨模态推理,提升地理空间数据分析能力,实现对地球的深入洞察。
视觉自校准:一种像素引导的准确图表解析范式
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CPII under InnoHK(创新香港下的CPII) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)
AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。
用人工智能掌握竞赛级物理
机构 * School of Physics, Peking University(物理系,北京大学) ; School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学系,北京大学) ; Center for High Energy Physics, Peking University(高能物理中心,北京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LOCA框架,通过逻辑链增强方法在物理竞赛中实现接近完美的成绩,展示了AI在复杂物理推理中的强大能力。
Comments 8 pages, 3 figures, Content from the previous article 2510.01249 is included
Doc-to-LoRA: 学习即时内化上下文
机构 * Minerva University, California, USA(明维大学,美国加利福尼亚州)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Doc-to-LoRA通过轻量级超网络实现单次前向传递中的近似上下文蒸馏,提升大语言模型在长上下文任务中的推理效率和准确性。
在回答和解释具有挑战性的医疗问题上评估大型语言模型
机构 * Rice University(里士满大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本文提出两个新数据集用于评估大型语言模型在回答和解释具有挑战性的医疗问题上的能力,并通过实验展示了这些数据集的难度及模型表现。
Comments NAACL 2025
多跳问答的MultiCube-RAG
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Korea University(韩国大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 MultiCube-RAG通过多维立方体结构实现多跳问答的高效推理与检索,提升响应准确率并增强可解释性。
Comments 12 pages
可信且公平的SkinGPT-R1:用于在不同种族中普及皮肤病推理
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) ; Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学) ; Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究所,天津中医研究院附属医院) ; Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) ; Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) ; School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院)
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);chain-of-thought(abstract)
AI总结 SkinGPT-R1通过公平性意识的专家混合架构实现可解释且公平的皮肤病诊断,提升不同种族间的诊断准确性与安全性。
通过多听众软执行平衡忠实与性能
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 REMUL通过多听众强化学习方法提升推理忠实性与性能,改进多个基准的忠实性指标和准确性。
Comments Code: https://github.com/nsivaku/remul
SurgRAW:基于链式推理的多智能体工作流用于机器人手术视频分析
机构 * National University of Singapore(国立新加坡大学) ; Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)(生物信息研究所(BII),科技研究局(A*STAR)) ; Wellcome/EPSRC Centre for Interventional and Surgical Sciences (WEISS) and the Department of Medical Physics and Biomedical Engineering, University College London(Wellcome/EPSRC介入与外科科学中心(WEISS)及伦敦大学学院医学物理与生物医学工程系)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 SurgRAW通过基于链式推理的多智能体工作流,在机器人手术视频分析中实现零样本多任务推理,提升准确性和临床相关性。
Journal ref IEEE Robotics and Automation Letters, 2026, pp. 1-8
IndicEval:一种用于大型语言模型的双语印度教育评估框架
机构 * Department of Computer Sciencce and Engineering(计算机科学与工程系) ; Swami Vivekanand Technical University Bhilai, India(斯瓦米·维韦kanand技术大学比哈尔,印度)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 IndicEval提出了一种双语印度教育评估框架,通过真实考试题目评估LLM的推理、领域知识和双语适应性,揭示了跨模型性能差异和多语言退化问题。
MAEB:大规模音频嵌入基准
机构 * Carleton University(卡尔顿大学) ; Durham University(杜伦大学) ; Stanford University(斯坦福大学) ; Aarhus University(奥胡斯大学) ; Indian Institute of Technology, Kharagpur(印度理工学院,卡里格普) ; Harvard University(哈佛大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MAEB是一个涵盖多语言音频任务的基准,揭示了不同模型在音频与语言任务上的性能差异,展示了音频编码器在跨模态任务中的表现关联性。
玩转AI:当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现如何?
机构 * University of Twente(特文特大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现,发现其在问题解决和推理能力上存在显著局限。
Comments 18 pages, 1 figure
增强语义 grounded 的动作和成分建模以实现语义 grounded 的食谱生成
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出语义 grounded 的框架,通过两阶段流程结合监督微调和强化微调,提升食谱生成的语义准确性与成分预测能力。
VerifyBench: 大型语言模型参考式奖励系统的基准测试
机构 * Zhejiang University(浙江大学) ; Meituan Group(美团集团) ; Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。
Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench
每一点帮助都有价值:通过细粒度可迁移多模态标记构建知识图谱基础模型
机构 * Zhejiang University, Zhejiang, China(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出TOFU模型,通过细粒度可迁移多模态标记提升多模态知识图谱推理的跨图谱迁移能力。
Comments Work in progress
大型语言模型用于协助美国大学申请
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。
视觉-语言模型在位置披露中是否尊重上下文完整性?
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。
Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench
提前窥视田野研究:探索VLM人设作为人机交互领域具身研究的支持工具
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出利用VLM人设模拟田野研究结果,验证其在具身研究中的应用潜力,发现其在响应模式上接近人类但缺乏多样性。
Comments Accepted to CHI 2026
MedVLThinker: 多模态医疗推理的简单基线
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Amazon Research(亚马逊研究院)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 MedVLThinker通过简单基线和RLVR方法,在医疗多模态推理中实现新突破,超越现有开源模型并接近专有模型性能。
Comments Project page: https://ucsc-vlaa.github.io/MedVLThinker/ ; Code: https://github.com/UCSC-VLAA/MedVLThinker ; Model and Data: https://huggingface.co/collections/UCSC-VLAA/medvlthinker-688f52224fb7ff7d965d581d ; Accepted by ML4H'25
语言统计与虚假信念推理:来自41个开放权重语言模型的证据
机构 * Rutgers University - Newark(新泽西罗格斯大学-新布朗斯维尔) ; UC San Diego(加州大学圣地亚哥分校) ; Stony Brook University(史泰文斯理工学院) ; MIT(麻省理工学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究通过41个开放权重语言模型测试,发现人类和模型在非事实性动词提示下对虚假信念的归因存在偏差,揭示语言统计学在解释人类认知中的局限性。
Comments 15 pages, 7 figures, submitted to conference
不是例子,而是过程:如何自动生成的例子增强LLM推理
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过对比不同提示策略,发现自动生成例子的过程增强了LLM推理性能,而非例子本身。
Comments Presented at AACL-IJCNLP 2025
通过协同推理与自适应融合进行多源异构公共意见分析:一种系统整合方法
机构 * Yi Liu School of Software Xi’an Jiaotong University(刘毅 软件学院 西安交通大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出CRAF框架,通过协同推理与自适应融合整合传统方法与LLMs,提升多源异构公共意见分析的跨平台适应性与性能
Comments 13 pages, 11 figures
DIAGPaper: 通过多智能体推理诊断科学论文中的有效且具体弱点
机构 * Penn State University(宾夕法尼亚州立大学) ; University of Sheffield(谢菲尔德大学)
专题命中 其他推理 :reasoning(title);分类 cs.AI
AI总结 DIAGPaper通过多智能体推理框架有效识别科学论文中的弱点,结合定制、反驳和优先模块提升弱点识别的准确性和优先级排序。
文献衍生聚合物知识的检索增强生成:生物降解聚合物专家系统的例子
机构 * School of Computational Science and Engineering(计算科学与工程学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Matmerize, Inc.(Matmerize公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出基于检索增强生成的聚合物知识系统,通过构建结构化知识图谱和语义向量方法,提升生物降解聚合物领域的文献检索与推理能力。
缩减方差:用于具有可验证奖励的强化学习的收缩基线
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出了一种基于收缩估计的基线方法,用于改进具有可验证奖励的强化学习中策略梯度估计器的方差,通过结合每个提示和跨提示的均值来提高估计准确性。
Comments Preprint. Under Review
深度时间序列预测中的时间先验条件:时间序列预测中的时间先验条件
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出TPC方法,通过时间先验条件提升时间序列预测性能,实现低参数预算下的长周期预测优化。
Comments Accepted to ICASSP 2026
LLMs在创造性写作中表现出显著低于专业作家的不确定性
机构 * McGill University(麦吉尔大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文研究了LLM在创造性写作中相较于专业作家的不确定性问题,发现模型输出的不确定性显著低于人类,提出需新的对齐方法以提升创造性写作质量。
Comments 11 tables
MaS-VQA: 一种基于掩码和选择的基于知识的视觉问答框架
机构 * Zhejiang University, Hangzhou, China(浙江大学, 杭州, 中国) ; Alibaba Group, Hangzhou, China(阿里巴巴集团, 杭州, 中国)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 MaS-VQA通过结合显式知识过滤与隐式知识推理,提升基于知识的视觉问答任务的准确性和鲁棒性。
FUTURE-VLA:在实时执行下统一轨迹预测
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。