Structured Multi-Step Reasoning for Entity Matching Using Large Language Model
基于大语言模型的结构化多步推理实体匹配
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 本文提出基于结构化多步推理的实体匹配框架,通过分解匹配过程为多个推理阶段,提升大语言模型在实体匹配任务中的性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于大语言模型的结构化多步推理实体匹配
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 本文提出基于结构化多步推理的实体匹配框架,通过分解匹配过程为多个推理阶段,提升大语言模型在实体匹配任务中的性能。
R-AVST:通过细粒度时空推理增强视频大语言模型以应对复杂音频视觉场景
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 R-AVST通过细粒度时空推理提升视频大语言模型,构建首个真实世界音频视觉时空推理数据集,并提出AVST-Zero模型增强推理能力。
Comments Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST
AutoPatch:多智能体框架用于修补现实世界中的CVE漏洞
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 AutoPatch通过多智能体框架高效修补LLM生成代码中的CVE漏洞,实现高准确率和低成本的漏洞修复
Comments 19 pages, double column, 9 figures. Under submission
关于基于大型语言模型的统计与数据科学代理的综述
机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。
Journal ref Am. Statist. (2025) 1-14
从复合图形到综合理解:开发一种从生物医学文献中基于医疗多图像基准测试和验证的多模态大语言模型
机构 * Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, CT 06510, USA(耶鲁医学院生物医学信息学与数据科学系,耶鲁大学,新 Haven,CT 06510,USA) ; School of Medicine, University of Puerto Rico, San Juan, PR 00921, USA(波多黎各大学医学院,波多黎各,San Juan,PR 00921,USA)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出M3LLM,一种基于生物医学文献中复合图像的多模态大语言模型,通过分而治之策略提升多图像理解能力,实验证明其在多图像、单图像等场景中表现优异。
Mavors:多粒度视频表示用于多模态大语言模型
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; Nanjing University(南京大学) ; CASIA(中国科学院自动化研究所)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Mavors通过多粒度视频表示方法,提升多模态大语言模型在长视频理解中的时空模式保留与计算效率平衡能力。
Comments 22 pages
专家足矣:一种用于大语言模型推理的可组合框架
机构 * School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 Comp-LLM通过可组合的推理框架实现跨专家协作,提升大语言模型的准确性和效率
强记忆,弱控制:对大语言模型执行功能的实证研究
机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) ; Department of Linguistics, Hamline University(语言学系,哈姆林大学) ; Department of Psychology, University of Wisconsin-Stout(心理学系,威斯尼斯托大学) ; Department of English, University of Minnesota(英语系,明尼苏达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 研究发现大语言模型在工作记忆方面表现优异,但执行功能和问题解决能力存在不足,提示需进一步改进注意力控制和认知灵活性。
注意间隔:为改进链式推理微调而弥合思维跳跃
机构 * Zhejiang University(浙江大学) ; SF Technology(SF技术) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,comments);reasoning(abstract);logical reasoning(abstract)
AI总结 本文提出CoT思维跳跃桥任务,通过生成缺失的中间推理步骤提升数学推理任务的性能,实验表明在NuminaMath上改进达+5.87%。
Comments Accepted to NeurIPS 2025. Camera ready version. Code: https://github.com/ZJU-REAL/Mind-the-Gap Project: https://zju-real.github.io/CoT-Bridge/
通过思维训练和无思维推理实现高效推理
机构 * Xi’an Jiaotong University(西安交通大学) ; JD Future Academy(京东未来学院)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 3TF通过训练混合模型实现高效推理,使模型能在无显式推理生成的情况下进行高质量推理。
Comments 11 pages, 4 figures
SAMChat:引入链式推理和GRPO以增强小规模遥感遥感小语言模型
机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中东部技术大学(METU)电子与电气工程系)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 SAMChat通过引入链式推理和GRPO,专为遥感影像分析优化,实现了在开放描述和分类任务上的高精度表现。
Comments Accepted to Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) Special Issue on Foundation and Large Vision Models for Remote Sensing. Code and dataset are available at https://github.com/aybora/SAMChat
ROVER:基于视觉语言模型的视频递归推理用于具身任务
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; RAI Institute(RAI研究院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 ROVER通过递归分解视频轨迹提升具身任务中的视频推理能力,有效减少幻觉并提高准确性。
ReasoningWeekly: 一个面向大语言模型的通用知识和逻辑推理挑战
机构 * Northeastern University(东北大学) ; Wellesley College(韦尔斯利学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cursor
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 ReasoningWeekly是一个基于NPR周日谜题挑战的通用知识和逻辑推理基准,揭示了现有评估中不明显的模型能力差距,并发现了新的推理失败类型。
OctoMed:面向尖端多模态医疗推理的数据配方
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 OctoMed通过结构化推理轨迹的数据配方,提升医疗多模态推理模型的性能和鲁棒性。
MathSight: 一个探索视觉语言模型在大学级数学推理中是否真正看到的基准
机构 * Capital Normal University(首都师范大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 MathSight基准测试通过对比不同视觉输入条件,探索视觉语言模型在大学级数学推理中视觉信息的真实贡献。
Comments Comments: 32 pages, 15 figures, 9 tables, includes appendix. Project page: https://cnu-bot-group.github.io/MathSight/
Video-CoM:通过操作链进行交互式视频推理
机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; University of California Merced(加州梅尔 Ced 大学) ; Google Research(谷歌研究院) ; Linköping University(林奈大学) ; Australian National University(澳大利亚国立大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 Video-CoM通过操作链实现交互式视频推理,提升视频理解任务的性能和可解释性
Comments Technical Report
DualVLA: 通过推理与行动部分解耦构建通用具身代理
机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) ; CUHK(香港大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。
OralGPT-Omni: 一种多功能的牙科多模态大语言模型
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) ; College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) ; School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) ; Singapore University of Technology and Design(新加坡科技与设计大学) ; University of Auckland(奥克兰大学) ; University of Science and Technology of China(中国科学技术大学) ; School of Computer Science, Peking University(北京大学计算机学院) ; College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。
Comments 47 pages, 42 figures, 13 tables
医疗恶意:用于医疗LLM中情境感知安全的数据库
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。
一个患者,许多情境:通过情境智能扩展医疗AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出情境切换技术,通过调整模型推理而非重新训练,使医疗AI能适应不同专科、人群和地理环境,提升其在现实护理中的可靠性和扩展性。
分层人工智能气象学家:用于多尺度和可解释性天气预报报告的LLM代理系统
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出分层人工智能气象学家,通过多尺度推理和关键词生成提升天气预报的可解释性和鲁棒性。
Comments 9 pages, 4 figures
读微笑:面部情绪识别基础模型中的代理偏差
机构 * CHI – Chair of Health Informatics, MRI, Technical University of Munich(慕尼黑技术大学健康信息学系) ; MCML – Munich Center for Machine Learning(慕尼黑机器学习中心) ; GLAM – Group on Language, Audio, & Music(语言、音频与音乐小组) ; MDSI – Munich Data Science Institute(慕尼黑数据科学研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了面部情绪识别基础模型中视觉线索的依赖性及潜在偏差,揭示了模型在情绪推理中的内在一致性及公平性风险。
Journal ref IEEE Access, Early Access, 2025
本福特定律的诅咒:追踪数字偏差到大语言模型中的数值幻觉
机构 * Nanyang Technological University(南洋理工大学) ; University College London(伦敦大学学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究发现LLMs在预训练中学习到的数字偏倚导致数值生成偏差,通过修剪特定神经元可缓解错误输出。
Comments NeurIPS 2025
RecToM:用于评估基于LLM的对话推荐系统机器理论 of mind 的基准
机构 * SMU(德克萨斯南方大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 RecToM是一个用于评估基于LLM的对话推荐系统中机器理论 of mind 能力的新基准,重点关注认知推理和行为预测两个维度。
Comments Accepted by AAAI 2026
DialBench: 通过大基础模型实现指针表盘读数的准确识别
机构 * School of Computer Science and Technology, Anhui University, Hefei 230601, China(安徽大学计算机科学与技术学院) ; School of Artificial Intelligence, Anhui University, Hefei 230601, China(安徽大学人工智能学院) ; Department of Computer Science and Information Technology, La Trobe University, Bendigo, Australia(拉筹伯大学计算机科学与信息技术系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出DialBench基准数据集和MRLM模型,通过物理关系注入提升指针表盘读数识别的准确性。
AppSelectBench: 应用级工具选择基准
机构 * Microsoft(微软)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。
大视觉语言模型真的在医学图像上具有基础性吗?来自意大利临床视觉问答的证据
机构 * SIIAM ; NSBProject ; Dept. of Life Sciences & Public Health, UCSC(生命科学与公共卫生系,UCSC) ; ASL RM 4 ; UCSC ; Univ. Paris Cité(巴黎Cité大学) ; Univ. of Pisa(比萨大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究通过测试四种先进模型在意大利医学问题上的表现,揭示了大视觉语言模型在视觉基础上的差异,强调了临床部署前的严格评估需求。
Comments Accepted at the Workshop on Multimodal Representation Learning for Healthcare (MMRL4H), EurIPS 2025
大语言模型如何在叙述中理解时间意义:一项对大语言模型认知评估的案例研究
机构 * University of Minnesota(明尼苏达大学) ; Hamline University(哈姆林大学) ; University of Wisconsin-Stout(威斯康星州立大学斯托特分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究通过实验发现,大语言模型在处理叙述中的时间意义时,过度依赖原型性,导致不一致的判断和因果推理困难,表明其与人类在理解叙述方面存在根本差异。
针对表格数据生成的大型语言模型指令微调——一天内完成
机构 * SIT(新加坡科技学院) ; NUS(新加坡国立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种在有限资源下通过指令微调提升LLM表格数据生成能力的方法,利用高质量数据集和少量指令实现与GPT-4o相当的生成性能。
Comments Accepted International Conference on Machine Learning (ICML 2025), 1st Workshop on Foundation Models for Structured Data
SlotVLA:迈向机器人操作中物体-关系表示的建模
机构 * University of Arkansas(亚拉巴马大学) ; FPT Software AI Center(FPT软件人工智能中心) ; University of Stuttgart(斯图加特大学) ; Aalborg University(奥尔堡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Liverpool(利物浦大学) ; German Research Center for Artificial Intelligence(德国人工智能研究中心) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
专题命中 推理评测 :reasoning(abstract)
AI总结 SlotVLA通过引入LIBERO+数据集和基于槽注意力的框架,实现高效且可解释的机器人操作中物体-关系表示建模。
Comments under review