Enhancing Tool Calling in LLMs with the International Tool Calling Dataset
通过国际工具调用数据集增强大语言模型的工具调用能力
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出国际工具调用数据集ITC,用于提升大语言模型在多语言、多地区工具调用场景中的性能与鲁棒性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过国际工具调用数据集增强大语言模型的工具调用能力
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出国际工具调用数据集ITC,用于提升大语言模型在多语言、多地区工具调用场景中的性能与鲁棒性。
FunnyNodules: 一种可定制的医学数据集,用于评估可解释AI
机构 * Ulm University Medical Center(乌尔姆大学医学中心) ; XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD——实验放射学人工智能合作) ; Department of Diagnostic and Interventional Radiology(诊断与介入放射学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 FunnyNodules是一种可定制的医学数据集,用于评估可解释AI模型的属性推理能力。
Comments accepted at Medical Imaging with Deep Learning (MIDL) 2026
EarthScape:一种用于地表地质制图和地表分析的多模态数据集
机构 * Kentucky Geological Survey(肯塔基地质调查局) ; University of Kentucky(肯塔基大学) ; Department of Computer Science(计算机科学系)
专题命中 推理评测 :planning(abstract)
AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。
UniM:一个统一的任意到任意交错多模态基准
机构 * NUS(新加坡国立大学) ; SCUT(上海交通大学) ; NTU(国立科技大学) ; NJU(南京大学) ; Microsoft Research(微软研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。
Comments 70 pages, 63 figures, 30 tables, CVPR
PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试
专题命中 推理评测 :reasoning(abstract)
AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。
Comments Accepted for CVPR 2026
社交网络中的理论发现:利用大语言模型自动化ERGM规范
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。
大规模上下文图的可扩展连接推断
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出一种结合统计剪枝与LLM推理的可扩展连接推断方法,用于提升大规模上下文图构建的精度与效率。
如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解
专题命中 推理评测 :reasoning(abstract)
AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。
vEcho:从漏洞验证到大语言模型主动发现的范式转变
专题命中 推理评测 :reasoning(abstract)
AI总结 vEcho利用大语言模型主动发现漏洞,显著提升检测率并降低误报率,同时发现新的0日漏洞。
RAG与GraphRAG:系统评估与关键洞察
专题命中 推理评测 :reasoning(abstract)
AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。
OmniFashion: 通过多任务视觉-语言学习实现通用时尚智能
机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心、人工智能研究院、计算机科学学院、武汉大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 OmniFashion通过多任务视觉-语言学习,构建百万级时尚数据集,实现统一的时尚对话范式,提升多任务推理和交互能力,推动通用时尚智能发展。
Comments 12 pages, 8 figures
ReSearch:一种用于地球科学数据发现的多阶段机器学习框架
专题命中 推理评测 :reasoning(abstract)
AI总结 ReSearch通过多阶段推理增强搜索框架,提升地球科学数据检索的召回率和排序性能,支持科学发现的可重复性和可扩展性。
PathMoE:用于儿童脑肿瘤分类的可解释多模态交互专家
机构 * University of Texas(德克萨斯大学) ; Dell Children’s Medical Center(德尔儿童医学中心) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Nevada, Reno(内华达大学里诺分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 PathMoE通过整合多模态信息提升儿童脑肿瘤分类性能,揭示了不同模态间的交互作用。
ReFeed: 基于检索反馈的领域感知查询重写数据集构建
专题命中 推理评测 :reasoning(abstract)
AI总结 ReFeed通过检索反馈驱动数据集构建,提升查询重写模型对文档风格的感知能力,改进领域特定场景下的检索效果。
Comments Accepted at the Workshop on New Frontiers in Information Retrieval (AAAI 2026)
对基于大语言模型的自动补丁架构的系统研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。
GroundedSurg: 一种多手术流程的语言条件手术工具分割基准
机构 * King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院) ; Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院) ; The University of Queensland(昆士兰大学) ; Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 GroundedSurg提出了一种多手术流程的语言条件手术工具分割基准,通过实例级接地和空间注释评估视觉-语言模型在临床真实场景中的性能。
视觉语言模型能否评估图形设计的审美?一个基准、评估和数据集的视角
机构 * Peking University(北京大学) ; Microsoft Research Asia(微软亚洲研究院) ; Microsoft(微软) ; Central South University(中南大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出AesEval-Bench基准,系统评估视觉语言模型在图形设计审美评估中的性能,并构建训练数据集以提升模型在该领域的表现。
Comments ICLR 2026
超越全局相似性:面向细粒度、多条件多模态检索
机构 * Shanghai Jiao Tong University(上海交通大学) ; Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。
Comments Accepted by CVPR 2026
FOCAL:多模态代理的新型基准测试技术
专题命中 推理评测 :reasoning(abstract)
AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。
Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)
VizQStudio: 基于模拟学生的迭代可视化素养多选题设计
专题命中 推理评测 :reasoning(abstract)
AI总结 VizQStudio通过模拟学生帮助教师迭代设计高质量可视化素养多选题,提升评估设计的灵活性和适应性。
Comments TVCG fast track (PVIS 2026 TVCG Track) under review
UNICBench: 多模态多层级计数基准与评估工具包
机构 * Northwestern Polytechnical University(北华大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) ; Sun Yat-sen University(中山大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 推理评测 :reasoning(abstract)
AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。
Comments This paper has been accepted by CVPR 2026
统一的生成与理解模型能否在不同输出模态间保持语义等价性?
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Xiamen University(厦门大学) ; Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。
Comments Equal contribution by Jie Li
MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。
VeriWeb: 可验证的长链网络基准测试用于代理信息检索
专题命中 推理评测 :reasoning(abstract)
AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。
超越检测:多尺度隐藏码用于自然图像深度伪造恢复与事实检索
机构 * IIS, Academia Sinica(中科院研究所)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出多尺度隐藏码框架,用于自然图像深度伪造恢复与事实检索,通过语义编码和条件Transformer模块提升检索与重建性能。
像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。
Comments 21 pages including 1 page of appendix, 9 figures, 4 tables
VoiceAlign:一种增强传统语音用户界面系统可用性的 shim 层
专题命中 推理评测 :planning(abstract)
AI总结 VoiceAlign 通过适应性 shim 层提升传统语音用户界面系统的可用性,减少命令失败并降低用户认知负担。
Comments Accepted at IUI'26
HetroD:一种用于异质交通中自动驾驶的高保真无人机数据集和基准
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; UC Berkeley(伯克利大学) ; fka GmbH
专题命中 推理评测 :planning(abstract)
AI总结 HetroD通过高保真无人机数据集和基准,解决异质交通中自动驾驶面临的复杂行为预测与规划挑战。
Comments IEEE International Conference on Robotics and Automation (ICRA) 2026
将语义转化为拓扑:基于LLM的属性增强协同过滤
专题命中 推理评测 :reasoning(abstract)
AI总结 基于LLM的属性增强协同过滤框架,通过拓扑连接性转换语义知识,提升协同过滤效果。
理解网络安全竞赛中的人机协作
专题命中 推理评测 :reasoning(abstract)
AI总结 研究探讨了网络安全竞赛中人类与AI协作的有效性,发现AI代理在自主引导提示和工具使用时能超越多数人类团队。