arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2505.22910 2026-04-30 cs.CL 57%

Talent or Luck? Evaluating Attribution Bias in Large Language Models

天赋还是运气?评估大语言模型中的归因偏差

Chahat Raj, Mahika Banerjee, Jinhao Pan, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) Thomas Jefferson High School For Science and Technology(托马斯·杰斐逊科学与技术高中) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨大语言模型在事件归因中的偏差,提出基于认知的评估框架,识别模型推理差异如何放大群体偏见。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20749 2026-04-30 cs.CL 57%

Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data

LLM代理能否模拟多轮人类行为?基于真实在线客户行为数据的证据

Yuxuan Lu, Jing Huang, Yan Han, Bingsheng Yao, Sisong Bei, Jiri Gesi, Yaochen Xie, Yisi Sang, Zheshen, Wang, Qi He, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过购物案例研究,首次对先进LLM在模拟人类行为方面的准确性进行大规模定量评估,发现基于提示的LLM仅能生成11.86%的人类行为,通过微调提升至17.26%和33.86%的F1分数,建立首个严谨的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25737 2026-04-29 cs.SE cs.AI 57%

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

SAFEdit:多智能体分解能否解决受指导代码编辑的可靠性挑战?

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(巴伊兰大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 SAFEdit通过多智能体框架分解编辑过程,提升代码编辑的可靠性与准确性,其迭代改进机制显著提高了任务成功率。

Comments Accepted to the EQUISA (Evaluation of Qualitative Aspects of Intelligent Software Assistants) workshop at EASE (Evaluation and Assessment in Software Engineering) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25720 2026-04-29 cs.CV cs.CL 57%

Toward Multimodal Conversational AI for Age-Related Macular Degeneration

迈向年龄相关性黄斑变性的多模态对话式人工智能

Ran Gu, Benjamin Hou, Mélanie Hébert, Asmita Indurkar, Yifan Yang, Emily Y. Chew, Tiarnán D. L. Keenan, Zhiyong Lu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。

Comments 38 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 57%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23773 2026-04-29 cs.AI cs.LO 57%

BayesL: a Logical Framework for the Verification of Bayesian Networks

BayesL:贝叶斯网络验证的逻辑框架

Stefano M. Nicoletti, E. Moritz Hahn, Mariëlle Stoelinga

机构 * University of Twente(特文特大学) University of Urbino(乌尔比诺大学) Radboud University(拉德堡德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BayesL逻辑框架,用于形式化表达、查询和验证贝叶斯网络的行为,通过支持概率推断和模型检查查询,提升贝叶斯网络的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 57%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI 57%

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24814 2026-04-29 cs.SE cs.AI 57%

SWE-QA: A Dataset and Benchmark for Complex Code Understanding

SWE-QA:复杂代码理解的数据库和基准测试

Laïla Elkoussy, Julien Perez

机构 * LRE, EPITA(EPITA研究中心) Bpifrance(法国国家研究基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SWE-QA数据集,用于评估多跳代码理解,填补了简化评估任务与真实软件开发中复杂推理之间的差距。数据集包含9072个多选问题,评估多种推理模式,评估15种语言模型显示多跳推理存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09093 2026-04-29 cs.LG 57%

Hidden States as Early Signals: Step-level Trace Evaluation and Pruning for Efficient Test-Time Scaling

隐藏状态作为早期信号:用于高效测试时间扩展的步骤级追踪评估与剪枝

Zhixiang Liang, Beichen Huang, Zheng Wang, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出STEP框架,通过评估隐藏状态实现步骤级追踪剪枝,有效降低推理延迟并提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11443 2026-04-29 cs.CL cs.SI 57%

A Transformer-Based Cross-Platform Analysis of Public Discourse on the 15-Minute City Paradigm

基于Transformer的跨平台公共 discourse 对15分钟城市范式的分析

Gaurab Chhetri, Darrell Anderson, Boniphace Kutela, Subasish Das

机构 * 1 College of Science Engineering, Texas State University, San Marcos, Texas, USA Email 3 Texas A\&M Transportation Institute, Texas A\&M University, Houston, Texas, USA Email

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本研究首次跨平台分析15分钟城市概念的公共 discourse,采用压缩Transformer模型进行多平台情感分类,发现DistilRoBERTa表现最佳,MiniLM一致性最高,揭示平台特性差异及压缩模型的高效优势。

Comments This is the author's preprint version of a paper accepted for presentation at the 24th International Conference on Machine Learning and Applications (ICMLA 2025), December 3-5, 2025, Florida, USA. The final published version will appear in the official IEEE proceedings. Conference site: https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24698 2026-04-28 cs.CL 57%

The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models

Chameleon的极限:探究大型语言模型中的人格崩溃与同质化

Yunze Xiao, Vivienne J. Zhang, Chenghao Yang, Ningshan Ma, Weihao Xuan, Jen-tse Huang

机构 * CMU(卡内基梅隆大学) UChicago(芝加哥大学) MIT(麻省理工学院) UTokyo(东京大学) RIKEN AIP(理化学研究所AIP分部) JHU(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大型语言模型中存在人格崩溃现象,导致代理行为模式趋同。通过提出覆盖度、均匀度和复杂度指标,揭示模型在不同维度和领域的人格表现差异,并释放工具支持群体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24690 2026-04-28 cs.CL 57%

Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination

LLMs能否成为历史学家?通过中国科举制度评估LLMs的历史研究能力

Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProHist-Bench基准,基于中国科举制度评估LLMs的历史研究能力,揭示其在复杂历史问题上的不足,旨在推动领域特定推理LLM的发展。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24618 2026-04-28 cs.AI 57%

Evaluating whether AI models would sabotage AI safety research

评估AI模型是否会破坏AI安全研究

Robert Kirk, Alexandra Souly, Kai Fronsdal, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所) UK AISI Research Affiliate(英国人工智能安全研究所研究附属)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估前沿模型在作为AI研究代理部署时对安全研究的破坏倾向,发现未提示下无破坏行为,但部分模型在持续破坏评估中表现出隐蔽破坏倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24572 2026-04-28 cs.AI cs.MA 57%

FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

FastOMOP:一种用于OMOP CDM数据上可靠代理现实世界证据生成的基础架构

Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang, Richard JB Dobson, Vishnu V Chandrabalan

机构 * Lancashire Teaching Hospitals NHS Foundation Trust(兰开夏教学医院国家健康服务信托基金会) Lancaster University(兰卡斯特大学) EPSRC DRIVE-Health, Department of Biostatistics & Health Informatics(EPSRC DRIVE-Health,生物统计学与健康信息学部门) King’s College London(伦敦国王学院) Institute for Health Informatics(健康信息学研究所) University College London(伦敦大学学院) NIHR Biomedical Research Centre(英国国家健康服务研究院生物医学研究中心) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金会) Health Data Research UK London(英国健康数据研究伦敦) South London and Maudsley NHS Foundation Trust and King’s College London(伦敦南部及莫德利国家健康服务信托基金会和伦敦国王学院) Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience(生物统计学与健康信息学部门,精神病学、心理学与神经科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FastOMOP架构,通过分离治理、可观测性和编排三层,解决代理系统在现实世界证据生成中的安全性和可靠性问题,验证结果显示其在不同数据集上均能保持高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24158 2026-04-28 cs.AI 57%

Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

多维评估可持续城市旅行的LLM-as-Judge与人机协同

Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多维评估可持续城市旅行推荐的框架,通过LLM-as-Judge和人类协同校准,解决传统指标忽略利益相关者目标的问题,揭示模型偏差与维度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24156 2026-04-28 cs.GT cs.AI 57%

Strategic Bidding in 6G Spectrum Auctions with Large Language Models

在6G频谱拍卖中使用大语言模型进行战略投标

Ismail Lotfi, Ali Ghrayeb

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了在车载网络中使用大语言模型作为投标代理进行6G频谱拍卖,探讨了LLM在预算约束下的投标策略及其对拍卖机制的影响。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23720 2026-04-28 cs.LG 57%

Quasi-Equivariant Metanetworks

准等变元网络

Viet-Hoang Tran, An Nguyen, Benoît Guérand, Thieu N. Vo, Tan M. Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出准等变元网络,通过引入准等变性概念,在保留功能一致性的同时,突破严格等变性的刚性限制,提升元网络的表达能力和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23653 2026-04-28 cs.CV cs.AI 57%

ResAF-Net: An Anchor-Free Attention-Based Network for Tree Detection and Agricultural Mapping in Palestine

ResAF-Net:一种基于注意力的无锚点网络用于巴勒斯坦树木检测和农业制图

Rabee Al-Qasem

机构 * AI-Developer Ministry of Labor - GGateway.ps(AI开发者劳动部 - GGateway.ps)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ResAF-Net,一种基于卫星的树木检测框架,用于资源受限环境下的大规模农业监测。该框架结合了ResNet-50编码器、ASPP、特征融合阶段、多头自注意力细化模块和无锚点FCOS检测头,实现了在密集和异质场景中对树木的高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23581 2026-04-28 cs.SE cs.CL 57%

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 57%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 57%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 57%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16419 2026-04-28 cs.SE cs.LG 57%

Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++

LLMs能否发现代码中的错误?对Python和C++中初级错误到安全漏洞的评估

Akshay Mhatre, Noujoud Nader, Patrick Diehl, Deepti Gupta

机构 * 1 Dept. of Computer Information Systems, Texas A\&M University - Central Texas, TX, 76549 USA. 2 LSU Center for Computation \& Technology, Louisiana State University, Baton Rouge, LA, 70803 USA. 3 Department of Physics Astronomy, Louisiana State University, Baton Rouge, LA, 70803 USA. 4 Applied Computer Science (CCS-7), Los Alamos National Laboratory, Los Alamos, NM 87545 USA.

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文评估了三个主流LLM在检测Python和C++中基础错误、经典安全漏洞及生产级bug的有效性,发现其在语法和语义问题上表现良好,但在复杂安全漏洞和大规模代码中性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23523 2026-04-28 cs.SE cs.AI 57%

Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

基于语言闭环的安全操作规则语法约束细化:可能发生的问题

Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi, Sam Emmanuel Kathiravan

机构 * University of Michigan--Dearborn(密歇根大学迪尔伯恩分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合反事实推理与语法约束循环的框架,用于安全操作规则的细化,通过自主驾驶控制系统案例展示其在解决不一致规则中的有效性,并强调语法约束与语义验证的重要性。

Comments 6 pages, 1 figure, 2 tables. Accepted at SEAMS 2026

Journal ref Proc. 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems (SEAMS 2026), ACM, 2026, 6 pages

详情
URL PDF HTML 收藏
2604.23366 2026-04-28 cs.AI cs.MA 57%

GSAR: Typed Grounding for Hallucination Detection and Recovery in Multi-Agent LLMs

GSAR:多智能体大语言模型中基于类型的 grounding 检测与恢复

Federico A. Kamelhar

机构 * Agentic AI Oracle Corporation(Agentic AI Oracle公司)

专题命中 推理评测 :self-correction(abstract);分类 cs.AI

AI总结 GSAR 提出了一种 grounding 评估与规划框架,通过四类分类、证据权重分配、矛盾惩罚评分和三层决策函数,实现多智能体大语言模型中的 hallucination 检测与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23051 2026-04-28 cs.CL 57%

Evaluating Temporal Consistency in Multi-Turn Language Models

评估多轮语言模型中的时间一致性

Yash Kumar Atri, Steven L. Johnson, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究多轮对话中语言模型维持和更新时间假设的能力,提出ChronoScope基准测试集,发现模型在长对话中时间一致性常被破坏,揭示单轮事实准确与序列交互中时间推理的差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22785 2026-04-28 cs.LG 57%

CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs

CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度

Stela Tong, Elai Ben-Gal

机构 * Stanford Graduate School of Business(斯坦福商学院) Stanford University(斯坦福大学) Department of Mathematics(数学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI 57%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10141 2026-04-28 cs.CV cs.CL cs.MM 57%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏