arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-26 至 2025-11-26 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 8 篇

2511.18808 2025-11-26 cs.CL cs.AI 62%

HyperbolicRAG: Enhancing Retrieval-Augmented Generation with Hyperbolic Representations

HyperbolicRAG: 通过双曲表示增强检索增强生成

Linxiao Cao, Ruitao Wang, Jindong Li, Zhipeng Zhou, Menglin Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HyperbolicRAG通过整合双曲几何提升基于图的检索增强生成,以更准确地捕捉语义和层次结构关系。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19768 2025-11-26 cs.CV cs.AI cs.RO 57%

Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering

剪枝后再规划:用于具身问答中稳定前沿探索的分步校准

Noah Frahm, Prakrut Patel, Yue Zhang, Shoubin Yu, Mohit Bansal, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Prune-Then-Plan通过分步校准稳定具身问答中的前沿探索,提升导航效率和回答质量。

Comments webpage: https://noahfrahm.github.io/Prune-Then-Plan-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 57%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00188 2025-11-26 cs.AI cs.SY eess.SY q-bio.NC 57%

Influence of the Geometry of the world model on Curiosity Based Exploration

世界模型几何对基于好奇心的探索的影响

Grégoire Sergeant-Perthuis, Nils Ruet, David Rudrauf, Dimitri Ognibene, Yvain Tisserand

机构 * LCQB Sorbonne Université & OURAGAN team, Inria Paris(LCQB 索邦大学及 OURAGAN 团队,巴黎研究所) CIAMS, Université Paris-Saclay, Orsay & Université d’Orléans(CIAMS,巴黎-萨克雷大学,欧塞比及奥尔良大学) Dipartimento di Psicologia, Università Milano-Bicocca(心理学系,米兰-比科卡大学) CISA, University of Geneva(日内瓦大学 CISA)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了世界模型几何结构对智能体好奇心驱动探索行为的影响,通过比较投影群与欧几里得群在知识价值和探索行为中的作用,揭示了几何结构在空间意识中的关键作用。

Journal ref Biol Cybern 119, 4 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20145 2025-11-26 cs.CV 50%

Vision-Language Models for Automated 3D PET/CT Report Generation

用于自动化3D PET/CT报告生成的视觉-语言模型

Wenpei Jiao, Kun Shang, Hui Li, Ke Yan, Jiajin Zhang, Guangjie Yang, Lijuan Guo, Yan Wan, Xing Yang, Dakai Jin, Zhaoheng Xie

机构 * Institute of Medical Technology and National Biomedical Imaging Center, Peking University(北京大学医学技术研究院和国家生物医学成像中心) Peking University People’s Hospital(北京大学人民医院) Peking University Third Hospital(北京大学第三医院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) The Affiliated Hospital of Qingdao University(青岛大学附属医院) The First Affiliated Hospital of Henan Medical University(河南医科大学第一附属医院) Jiujiang City Key Laboratory of Cell Therapy, Jiu Jiang NO.1 People’s Hospital(九江市细胞治疗重点实验室,九江市第一人民医院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出PETRG-3D模型,通过3D双分支框架和风格适应提示,提升PET/CT报告生成的自动化水平,实验显示其在自然语言和临床指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 2 篇

2511.19671 2025-11-26 cs.AI 57%

FISCAL: Financial Synthetic Claim-document Augmented Learning for Efficient Fact-Checking

FISCAL: 金融合成声明-文档增强学习用于高效事实核查

Rishab Sharma, Iman Saberi, Elham Alipour, Jie JW Wu, Fatemeh Fard

机构 * Charli Capital(Charli资本) University of British Columbia(不列颠哥伦比亚大学) Michigan Technological University(密歇根技术大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 FISCAL通过生成领域特定合成数据和高效微调,使小型模型在金融事实核查任务中达到最先进的准确性、鲁棒性和可扩展性。

Comments 3 tables, 11 pages, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20390 2025-11-26 cs.CV 50%

FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers

FREE: 用于并行扩散变换器的不确定性感知自回归

Xinwan Wen, Bowen Li, Jiajun Luo, Ye Li, Zhi Wang

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 FREE通过引入不确定性感知的自回归方法,在并行扩散变换器中实现高效的无损加速,提升去噪效率的同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 8 篇

2510.05034 2025-11-26 cs.CV 82%

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用

Yolo Y. Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。

Comments Version v1.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20468 2025-11-26 cs.AI 79%

DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs

DRAFT-RL: 多智能体链式草稿推理用于强化学习增强的大型语言模型

Yuanhao Li, Mingshan Liu, Hongbo Wang, Yiding Zhang, Yifei Ma, Wei Tan

机构 * BUPT(北京邮电大学) HKUST(GZ)(香港科技大学(广州)) University of Bristol(布里斯托大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 DRAFT-RL通过多智能体链式草稿推理提升强化学习增强的LLM在复杂推理任务中的准确性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20519 2025-11-26 cs.CV cs.AI 79%

Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning

Metis-HOME: 面向多模态推理的混合优化专家混合模型

Xiaohan Lan, Fanfan Liu, Haibo Qiu, Siqi Yang, Delian Ruan, Peng Shi, Lin Ma

机构 * Meituan(美团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 Metis-HOME通过混合优化专家混合模型,提升多模态推理的复杂推理能力和通用能力,解决推理与泛化之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05130 2025-11-26 cs.AI 79%

Scalable and Accurate Graph Reasoning with LLM-based Multi-Agents

基于大语言模型的多智能体图推理方法

Yuwei Hu, Runlin Lei, Xinyi Huang, Zhewei Wei, Yongchao Liu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 基于大语言模型的多智能体图推理方法,通过分解图问题为节点中心任务,提升图推理的准确性和扩展性。

Comments Accepted by AAAI 2026 Workshop WMAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18847 2025-11-26 cs.CL cs.AI 73%

ConfTuner: Training Large Language Models to Express Their Confidence Verbally

ConfTuner: 训练大型语言模型以口头表达其置信度

Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ConfTuner通过引入标记化布里尔分数损失函数,有效提升大型语言模型的置信度校准能力,适用于多种推理任务并泛化至黑盒模型。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20109 2025-11-26 cs.LG 57%

CLIMATEAGENT: Multi-Agent Orchestration for Complex Climate Data Science Workflows

CLIMATEAGENT: 多智能体编排用于复杂气候数据科学工作流

Hyeonjae Kim, Chenyue Li, Wen Deng, Mengxi Jin, Wen Huang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.LG

AI总结 ClimateAgent通过多智能体编排和动态API意识,实现端到端自动化气候数据分析,取得优于基线方法的高任务完成率和报告质量。

Comments 30 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20086 2025-11-26 cs.CL 57%

More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering

更多偏见,更少偏见:用于增强多项选择题回答的BiasPrompting

Duc Anh Vu, Thong Nguyen, Cong-Duy Nguyen, Viet Anh Nguyen, Anh Tuan Luu

机构 * Nanyang Techonological University(南洋理工大学) National University of Singapore(国立新加坡大学) Centre for AI research, VinUniversity(Vin大学人工智能研究中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 BiasPrompting通过引导LLMs生成并评估所有可能答案的推理过程,提升多项选择题回答的推理能力,尤其在复杂问题中表现优异。

Comments Accepted at the 41st ACM/SIGAPP Symposium On Applied Computing (SAC 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19483 2025-11-26 cs.SE cs.AI 57%

Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation

Z-Space:面向企业级LLM自动化的一种多智能体工具协调框架

Qingsong He, Jing Nan, Jiayu Jiao, Liangjie Tang, Xiaodong Xu, Mengmeng Sun, Qingyao Wang, Minghui Yan

机构 * Rajax Network Technology (ele.me)(Rajax网络技术(ele.me))

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 Z-Space通过多智能体协作框架提升企业级LLM自动化工具调用效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 17 篇

2505.20426 2025-11-26 cs.CV 82%

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG 82%

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20531 2025-11-26 cs.AI cs.CV cs.LG 81%

Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models

超越生成:面向视觉语言模型事实准确性的多跳推理

Shamima Hossain

机构 * Department of Computer Science, Brac University(布鲁尔大学计算机科学系) bKash Limited(bKash公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于知识图谱的多跳推理框架,提升视觉语言模型在事实准确性上的表现,通过多步骤推理增强模型的逻辑推理能力。

Comments Accepted as poster at NewInML Workshop ICML, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19496 2025-11-26 cs.LG cs.AI 81%

Xmodel-2.5: 1.3B Data-Efficient Reasoning SLM

Xmodel-2.5: 1.3B数据高效推理SLM

Yang Liu, Xiaolong Zhong, Ling Jiang

机构 * Xiaoduo AI Lab(小多人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Xmodel-2.5通过最大更新参数化和混合精度训练,实现了1.3B参数高效推理模型,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25628 2025-11-26 cs.CL 79%

EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis

EHR-R1: 一种增强推理能力的基础语言模型用于电子健康记录分析

Yusheng Liao, Chaoyi Wu, Junwei Liu, Shuyang Jiang, Pengcheng Qiu, Haowen Wang, Yun Yue, Shuai Zhen, Jian Wang, Qianrui Fan, Jinjie Gu, Ya Zhang, Yanfeng Wang, Yu Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligence Healthcare Department, AntGroup(智能医疗部,蚂蚁集团) Intelligence Computing and Sensing Laboratory, Peking University(智能计算与感知实验室,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 EHR-R1是一种针对电子健康记录分析设计的增强推理能力的基础语言模型,通过大规模推理数据集和多阶段训练方法提升了EHR分析的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01341 2025-11-26 cs.CL 79%

TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models

TurnBench-MS: 一个评估大语言模型多轮多步推理能力的基准

Yiran Zhang, Mo Wang, Xiaoyang Li, Kaixuan Ren, Chencheng Zhu, Usman Naseem

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 TurnBench-MS通过互动破码任务评估大语言模型的多轮多步推理能力,揭示当前模型在复杂推理任务中的显著不足。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025

Journal ref Findings of the ACL: EMNLP 2025, pp. 19892-19924, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11118 2025-11-26 cs.CL cs.AI 73%

UMB@PerAnsSumm 2025: Enhancing Perspective-Aware Summarization with Prompt Optimization and Supervised Fine-Tuning

UMB@PerAnsSumm 2025: 通过提示优化和监督微调增强视角感知摘要

Kristin Qi, Youxiang Zhu, Xiaohui Liang

机构 * Department of Computer Science, University of Massachusetts Boston(计算机科学系,马萨诸塞大学波士顿分校)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 UMB@PerAnsSumm 2025通过提示优化和监督微调提升视角感知摘要质量,结合关键词和引导信息优化摘要生成过程。

Comments CL4HEALTH NAACL: Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16383 2025-11-26 cs.CL 70%

Large Language Models in Argument Mining: A Survey

大型语言模型在论证挖掘中的应用:综述

Hao Li, Viktor Schlegel, Yizheng Sun, Riza Batista-Navarro, Goran Nenadic

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。

Comments Work draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV 67%

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 62%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19798 2025-11-26 cs.AI cs.HC cs.LG cs.MA 62%

KOM: A Multi-Agent Artificial Intelligence System for Precision Management of Knee Osteoarthritis (KOA)

KOM:一种用于膝骨关节炎(KOA)精准管理的多智能体人工智能系统

Weizhi Liu, Xi Chen, Zekun Jiang, Liang Zhao, Kunyuan Jiang, Ruisi Tang, Li Wang, Mingke You, Hanyu Zhou, Hongyu Chen, Qiankun Xiong, Yong Nie, Kang Li, Jian Li

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 KOM通过多智能体系统实现膝骨关节炎的自动化评估与管理,提升诊疗效率和个性化治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20067 2025-11-26 cs.AI cs.HC 57%

"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

我们完成了吗?

Marta Sumyk, Oleksandr Kosovan

专题命中 推理评测 :self-correction(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。

Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19875 2025-11-26 cs.SE cs.AI 57%

CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection

CodeFuse-CommitEval: 向基于提交信息和代码变更不一致检测的LLM能力基准测试迈进

Qingyu Zhang, Puzhuo Liu, Peng Di, Chenxiong Qian

机构 * Ant Group(蚂蚁集团) The University of Hong Kong(香港大学) Tsinghua University(清华大学) The University of New South Wales(新南威尔士大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 CodeFuse-CommitEval是首个用于评估LLM检测提交信息与代码变更不一致能力的基准,通过生成七类不一致消息并验证样本,评估六种开源LLM在不同增强策略下的表现,揭示了不同增强方法对模型性能的影响及不同类型不一致的检测差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20192 2025-11-26 cs.LG cs.IR 57%

FunReason: Enhancing Large Language Models' Function Calling via Self-Refinement Multiscale Loss and Automated Data Refinement

FunReason: 通过自精炼多尺度损失和自动化数据精炼增强大语言模型的功能调用

Bingguang Hao, ZengZhuang Xu, Maolin Wang, Yuntao Wen, Yicheng Chen, Cunyin Peng, Long Chen, Dong Wang, Xiangyu Zhao, Jinjie Gu, Chenyi Zhuang, Ji Zhang

机构 * AWorld Team, Inclusion AI(AWorld Team,Inclusion AI) City University of Hong Kong(香港城市大学) Southwest Jiaotong University(西南交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 FunReason通过自精炼多尺度损失和自动化数据精炼方法,提升大语言模型的功能调用能力,实现性能接近GPT-4o并缓解微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 57%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏