arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2602.02496 2026-02-04 cs.CL 83%

The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders

虚假差距:通过稀疏自编码器量化内部信念与思维链解释之间的分歧

Shikhar Shiromani, Archie Chaudhury, Sri Pranav Kunda

机构 * Independent(独立研究者)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 通过稀疏自编码器量化模型内部信念与生成回答之间的差异,以检测模型的不忠实行为。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 82%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02975 2026-02-04 cs.CL cs.AI cs.LG 82%

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

规范与参照的碰撞:评估大语言模型在规范推理中的能力

Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SNIC测试平台,评估大语言模型在基于规范的参照解析任务中的能力,发现现有模型在处理隐含或冲突规范时存在显著不足。

Comments Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02581 2026-02-04 cs.LG cs.AI 81%

QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals

QuantLRM:通过微调信号对大推理模型进行量化

Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 QuantLRM通过微调信号对大推理模型进行量化,通过拟合二次函数保护两端,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02497 2026-02-04 cs.CL cs.AI 81%

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models

STEMVerse: 一种用于大型语言模型中STEM推理的双轴诊断框架

Xuzhao Li, Xuchen Li, Jian Zhao, Shiyu Hu

机构 * NTU(国立科技大学) ZGCA(智能计算协会) ZGCI(智能计算研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 STEMVerse通过双轴诊断框架系统分析LLM在STEM领域的推理能力,揭示其结构失败模式,提供科学推理的深入理解。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02125 2026-02-04 cs.AI cs.CL 81%

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

AI模型在不同模态下是否能进行类人抽象推理?

Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

机构 * Santa Fe Institute, New Mexico, USA(圣菲研究所) Sandia National Laboratories, New Mexico, USA(桑迪亚国家实验室) Advanced Micro Devices Inc., Texas, USA(先进微器件公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI模型在不同模态下进行抽象推理的能力,发现其在文本和视觉模态中的表现存在显著差异,表明仅依赖准确率评估抽象推理能力存在偏差。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03340 2026-02-04 cs.AI 79%

MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis

MentalSeek-Dx: 向现实世界精神病诊断的渐进性假说-演绎推理迈进

Xiao Sun, Yuming Yang, Junnan Zhu, Jiang Zhong, Xinyu Zhou, Kaiwen Wei

机构 * School of Computer Science Chongqing University(重庆大学计算机学院) MAIS Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MentalSeek-Dx通过监督轨迹构建和课程强化学习,实现了在现实世界精神病诊断中的渐进性假说-演绎推理,以提升临床诊断的可靠性。

Comments 36 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 79%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 79%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 78%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02444 2026-02-04 cs.IR cs.CV 78%

RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval

RANKVIDEO: 文本到视频检索中的推理重排序

Tyler Skow, Alexander Martin, Benjamin Van Durme, Rama Chellappa, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RANKVIDEO通过基于视频内容的推理机制,提升了文本到视频检索的重排序性能,实验显示在nDCG@10上平均提升31%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18533 2026-02-04 cs.CV cs.CL cs.CR 77%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI 70%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03181 2026-02-04 cs.SE 67%

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

通过自我调试合成文件级数据用于单元测试生成的链式思考

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao Xie

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 通过自我调试合成文件级数据用于单元测试生成,提升测试生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00508 2026-02-04 cs.CV 67%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21602 2026-02-04 cs.RO 67%

AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation

AIR-VLA:面向空中操作的视觉-语言-动作系统

Jianli Sun, Bin Tian, Qiyao Zhang, Chengxiang Li, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院) School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 AIR-VLA提出首个针对空中操作的视觉-语言-动作系统,通过构建仿真环境和多模态数据集,评估主流模型并揭示其在无人机移动、机械臂控制和高层规划中的能力和限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03633 2026-02-04 cs.CL cs.AI cs.DB 62%

BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish

BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应

Burak Aktaş, Mehmet Can Baytekin, Süha Kağan Köse, Ömer İlbilgi, Elif Özge Yılmaz, Çağrı Toraman, Bilge Kaan Görür

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07020 2026-02-04 cs.CL cs.AI 62%

TurkBench: A Benchmark for Evaluating Turkish Large Language Models

TurkBench:评估土耳其大型语言模型的基准测试

Çağrı Toraman, Ahmet Kaan Sever, Ayse Aysu Cengiz, Elif Ecem Arslan, Görkem Sevinç, Mete Mert Birdal, Yusuf Faruk Güldemir, Ali Buğra Kanburoğlu, Sezen Felekoğlu, Osman Gürlek, Sarp Kantar, Birsen Şahin Kütük, Büşra Tufan, Elif Genç, Serkan Coşkun, Gupse Ekin Demir, Muhammed Emin Arayıcı, Olgun Dursun, Onur Gungor, Susan Üsküdarlı, Abdullah Topraksoy, Esra Darıcı

机构 * Computer Sci. Dpt., Bilkent Uni.(计算机科学系,比尔肯特大学) Mathematics Dpt., Middle East Technical University(数学系,中东部技术大学) Turkcell AI(Turkcell人工智能) Sociology Dpt., Hacettepe University(社会学系,哈恰塔尔佩大学) Computer Engineering Dpt., Bogazici University(计算机工程系,博资基大学) Linguistics Dpt., Istanbul University(语言学系,伊斯坦布尔大学) Turkish Lang. Dpt., Middle East Technical University(土耳其语言系,中东部技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TurkBench是一个用于评估土耳其大型语言模型能力的综合基准测试,包含21个子任务和6大类别,旨在帮助研究人员改进模型性能。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03709 2026-02-04 cs.CL 57%

No Shortcuts to Culture: Indonesian Multi-hop Question Answering for Complex Cultural Understanding

没有捷径的文化:印尼多跳问答用于复杂文化理解

Vynska Amalia Permadi, Xingwei Tan, Nafise Sadat Moosavi, Nikos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ID-MoCQA是一个基于印尼传统的多跳问答数据集,旨在评估大型语言模型的文化理解能力,揭示模型在文化推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03587 2026-02-04 cs.CL 57%

CL-bench: A Benchmark for Context Learning

CL-bench: 一个用于上下文学习的基准测试

Shihan Dou, Ming Zhang, Zhangyue Yin, Chenhao Huang, Yujiong Shen, Junzhe Wang, Jiayi Chen, Yuchen Ni, Junjie Ye, Cheng Zhang, Huaibing Xie, Jianglu Hu, Shaolei Wang, Weichao Wang, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Pluto Zhou, Tao Gui, Zuxuan Wu, Xipeng Qiu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CL-bench是一个用于评估上下文学习能力的基准测试,通过复杂任务和上下文设计,揭示当前语言模型在真实任务中的学习瓶颈。

Comments 78 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 57%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03134 2026-02-04 cs.CV cs.AI 57%

SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass

SwiftVLM: 通过跨层令牌绕过实现高效的视觉-语言模型推理

Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma, Xin Miao

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SwiftVLM通过跨层令牌绕过方法,在视觉-语言模型中实现高效的推理,优于现有修剪策略,提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03128 2026-02-04 cs.AI 57%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02601 2026-02-04 cs.SI cs.AI 57%

CaST: Causal Discovery via Spatio-Temporal Graphs in Disaster Tweets

基于灾难推文的时空图因果发现:CaST

Hieu Duong, Eugene Levin, Todd Gary, Long Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CaST通过整合语义、时空信息,利用大规模语言模型构建事件图,实现灾难推文中更稳健和可解释的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 57%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI 57%

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00748 2026-02-04 cs.DC cs.AI cs.AR 57%

HyperOffload: Graph-Driven Hierarchical Memory Management for Large Language Models on SuperNode Architectures

HyperOffload: 图驱动的分层内存管理用于超节点架构上的大型语言模型

Fangxin Liu, Qinghua Zhang, Hanjing Shen, Zhibo Liang, Li Jiang, Haibing Guan, Chong Bao, Xuefeng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HyperOffload通过图驱动的编译器方法优化超节点架构上的LLM内存管理,减少峰值内存使用并提升计算效率。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11361 2026-02-04 cs.AI 57%

MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization

MAPGD:多智能体提示梯度下降用于协作提示优化

Yichen Han, Yuhang Han, Siteng Huang, Guanyu Liu, Zhengpeng Zhou, Bojun Liu, Yujia Zhang, Isaac N Shi, Lewei He, Tianyu Shi

机构 * South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Macau(澳门大学) University of Sydney(悉尼大学) Silicon Sapiens LLC University of Alberta(阿尔伯塔大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAPGD通过多智能体协作机制提升提示优化的鲁棒性和效率,结合梯度融合与动态加权实现高效且可解释的优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23155 2026-02-04 cs.RO 50%

LAGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Rabeya Akter, Safaeid Hossain Arib

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 推理评测 :reasoning(abstract)

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03056 2026-02-04 cs.IR 50%

ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding

ALPBench:一种用于属性级长期个人行为理解的基准测试

Lu Ren, Junda She, Xinchen Luo, Tao Wang, Xin Ye, Xu Zhang, Muxuan Wang, Xiao Yang, Chenguang Wang, Fei Xie, Yiwei Zhou, Danjun Wu, Guodong Zhang, Yifei Hu, Guoying Zheng, Shujie Yang, Xingmei Wang, Shiyao Wang, Yukun Zhou, Fan Yang, Size Li, Kuo Cai, Qiang Luo, Ruiming Tang, Han Li, Kun Gai

专题命中 推理评测 :reasoning(abstract)

AI总结 ALPBench是一种用于属性级长期个人行为理解的基准测试,通过预测用户感兴趣的属性组合,实现对个性化推荐的细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏