arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2604.00304 2026-04-02 cs.CL cs.AI 62%

Asymmetric Actor-Critic for Multi-turn LLM Agents

多轮LLM代理的非对称Actor-Critic

Shuli Jiang, Zhaoyang Zhang, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出非对称Actor-Critic框架,利用专有LLM作为Actor,开源模型作为Critic,提升多轮对话可靠性。实验显示该方法在τ-bench和UserBench上优于单Agent基线,且轻量级Critic表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 62%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00005 2026-04-02 cs.AI cs.CL 62%

How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study

情绪如何塑造大语言模型和代理的行为:一种机制性研究

Moran Sun, Tianlin Li, Yuwei Zheng, Zhenhong Zhou, Aishan Liu, Xianglong Liu, Yang Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出E-STEER框架,通过在隐藏状态中嵌入情绪作为可控变量,研究情绪对推理、生成、安全性和多步代理行为的影响,揭示情绪与行为之间的非单调关系。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24639 2026-04-02 cs.LG cs.AI 62%

Experiential Reflective Learning for Self-Improving LLM Agents

经验反思学习用于自我改进的LLM代理

Marc-Antoine Allard, Arnaud Teinturier, Victor Xing, Gautier Viaud

机构 * Illuin Technology

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经验反思学习框架,通过反思任务轨迹生成可迁移的启发式方法,提升LLM代理在Gaia2基准上的任务完成可靠性与成功率。

Comments Published as a conference paper at the ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG 62%

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28569 2026-03-31 cs.LG cs.AI cs.IR cs.PF 62%

CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments

CirrusBench:在真实云服务环境中评估基于LLM的代理超越正确性的能力

Yi Yu, Guangquan Hu, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Junzhuo Ma, Weiting Liu, Jianfeng Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University(复旦大学数学科学学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) Alibaba Group(阿里巴巴集团) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学应用数学中心暨上海市现代应用数学重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CirrusBench框架,基于真实云服务工单数据评估LLM代理的鲁棒性和解决效率,引入客户导向指标量化服务质量,揭示现有模型在复杂多轮任务中的不足。

Comments Submitted for SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05548 2026-03-31 cs.LG cs.AI 62%

Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

揭示隐含的优势对称性:为什么GRPO在探索和适应难度上遇到困难

Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文指出GRPO在探索和适应难度上的瓶颈源于隐含的优势对称性,提出不对称GRAE方法提升探索效率和学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16216 2026-03-31 cs.AI cs.LG 62%

FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis

FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展

Zhen Hao Wong, Jingwen Deng, Yuzhao Wang, Wenkai Yu, Jihao Huang, Runming He, Chengyu Shen, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 62%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27164 2026-03-31 cs.AI cs.CL 62%

daVinci-LLM:Towards the Science of Pretraining

daVinci-LLM:迈向预训练的科学

Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

机构 * SII SJTU(上海交通大学) GAIR

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出daVinci-LLM,通过结合工业级资源与科研自由,探索预训练的科学方法。采用开放范式,通过数据达尔文主义框架和两阶段适应课程,训练3B参数模型,验证处理深度对能力的影响及不同领域饱和动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23575 2026-03-26 cs.LG cs.AI 62%

APreQEL: Adaptive Mixed Precision Quantization For Edge LLMs

APreQEL: 适应性混合精度量化用于边缘大语言模型

Meriem Bouzouad, Yuan-Hao Chang, Jalil Boukhobza

机构 * Lab-STICC, CNRS UMR 6285 , ENSTA, Institut Polytechnique de Paris(法国巴黎理工学院STICC实验室、CNRS UMR 6285、ENSTA) National Taiwan University(台湾国立台湾大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种适应性混合精度量化方法,通过分析层间贡献和硬件平台行为,优化边缘部署中的内存、延迟和精度平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23515 2026-03-26 cs.CL cs.AI 62%

Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data

利用隐私保护的合成临床数据训练大型语言模型进行医学编码

John Cook, Michael Wyatt, Peng Wei, Iris Chin, Santosh Gupta, Van Zyl Van Vuuren, Richie Siburian, Amanda Spicer, Kristen Viviano, Alda Cami, Raunaq Malhotra, Zhewei Yao, Jeff Rasley, Gaurav Kaushik

机构 * Veradigm Snowflake

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用隐私保护的合成临床数据训练大型语言模型进行医学编码的可行性,通过微调Llama 3-70B模型,实现了ICD-10-CM和CPT代码的高精度预测,显著提升了编码准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23495 2026-03-25 cs.CV cs.AI cs.LG 62%

VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

VISion On Request: 基于稀疏、动态选择的视觉-语言交互提升大模型效率

Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Yassine Ouali, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星AI剑桥实验室) Technical University of Iasi(伊阿斯技术大学) Queen Mary University of London(伦敦女王玛丽大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VISOR通过稀疏化视觉-语言交互提升大模型效率,无需丢弃视觉信息,动态分配计算资源,实验表明在多样基准和挑战任务中性能优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18788 2026-03-25 cs.CL cs.AI 62%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05486 2026-03-25 cs.CL cs.AI 62%

The Token Tax: Systematic Bias in Multilingual Tokenization

令牌税:多语言令牌化中的系统性偏差

Jessica M. Lundin, Ada Zhang, Nihal Karim, Hamza Louzan, Victor Wei, David Adelani, Cody Carroll

机构 * Institute for Disease Modeling(疾病建模研究所) Gates Foundation(盖茨基金会) University of San Francisco(旧金山大学) McGill University(麦吉尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现令牌化效率对形态复杂、低资源语言有结构性劣势,影响计算资源和准确性。通过评估10种大语言模型在AfriMMLU数据集上的表现,发现令牌密度与准确性成反比,且推理模型在多语言任务中表现更优,揭示了令牌膨胀带来的经济负担。

Journal ref Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02426 2026-03-24 cs.CL cs.AI 62%

Comparative Analysis of AI Agent Architectures for Entity Relationship Classification

面向实体关系分类的AI代理架构比较分析

Maryam Berijanian, Kuldeep Singh, Amin Sehati

机构 * Michigan State University(密歇根州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了三种基于大语言模型的AI代理架构在实体关系分类中的性能,发现多代理协作优于少样本提示方法,接近微调模型性能。

Journal ref Proceedings of the 18th International Conference on Agents and Artificial Intelligence, Volume 1: ICAART, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20321 2026-03-24 q-bio.MN cs.AI cs.CL 62%

GIP-RAG: An Evidence-Grounded Retrieval-Augmented Framework for Interpretable Gene Interaction and Pathway Impact Analysis

GIP-RAG: 一种基于证据的检索增强框架用于可解释的基因互作和通路影响分析

Fujian Jia, Jiwen Gu, Cheng Lu, Dezhi Zhao, Mengjiang Huang, Yuanzhi Lu, Xin Liu, Kang Liu

机构 * Kanghua Juntai Biotech Co. Ltd.(康华联合生物科技有限公司) Department of Radiation Oncology, Cancer Treatment Center, The Second Affiliated Hospital of Hainan Medical University(海南医学院第二附属医院放疗科、肿瘤治疗中心) Department of Nutrition, University of California, Davis(加州大学戴维斯分校营养系) Department of Pathology, The First Affiliated Hospital of Jinan University(暨南大学第一附属医院病理科)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GIP-RAG结合生物知识图谱与大语言模型,通过检索增强生成方法解析基因互作及通路影响,提供可解释的多步推理和机制解释。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19574 2026-03-23 cs.HC cs.AI cs.CL cs.CY cs.SI 62%

AI Psychosis: Does Conversational AI Amplify Delusion-Related Language?

AI精神病:对话AI是否会放大妄想相关语言?

Soorya Ram Shimgekar, Vipin Gunda, Jiwon Kim, Violeta J. Rodriguez, Hari Sundaram, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨对话AI对妄想相关语言的影响,通过模拟用户和三种模型家族分析妄想语言的变化,发现高妄想用户对话中妄想得分持续上升,而AI响应可有效降低此趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-03-20 cs.AI cs.LG 62%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03415 2026-03-20 cs.CL cs.AI 62%

Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs

越远离分布,表示越稀疏:分析LLM中的OOD机制

Mingyu Jin, Yutong Yin, Jingcheng Niu, Qingcheng Zeng, Wujiang Xu, Mengnan Du, Wei Cheng, Zhaoran Wang, Tianlong Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) UKP Lab, TU Darmstadt(德累斯顿技术大学UKP实验室) New Jersey Institute of Technology(新泽西理工学院) NEC Lab American(美国NEC实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在面对难度增加的输入时内部表示的适应机制,发现任务难度提升导致最后隐藏层表示稀疏化,提出基于稀疏性的课程学习策略提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16440 2026-03-18 cs.LG cs.CL 62%

Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Models

基于能力的压缩:迈向大语言模型中可解释性感知的预算分配

Rishaank Gupta

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于能力的压缩方法,通过能力密度图分配不同压缩预算,解决传统压缩方法中缺乏对模型组件功能编码表示的问题,证明高能力密度组件具有更低的结构冗余和更早达到相变点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05549 2026-03-18 cs.LG cs.AI cs.IR 62%

AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs

AGRAG: 面向大语言模型的高级图基检索增强生成框架

Yubo Wang, Haoyang Li, Fei Teng, Lei Chen

机构 * The Hong Kong University of Science(香港科学与技术大学) The Hong Kong Polytechnic University Hong Kong SAR(香港理工大学(香港特别行政区))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AGRAG通过统计方法构建图结构,解决LLM幻觉问题,并采用MCMI子图生成提升推理能力,实现更全面的推理路径,提升检索增强生成效果。

Comments ICDE 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13256 2026-03-17 cs.CL cs.AI cs.ET cs.MA 62%

Training-Free Agentic AI: Probabilistic Control and Coordination in Multi-Agent LLM Systems

无需训练的代理AI:多代理大语言模型系统的概率控制与协调

Mohammad Parsa Hosseini, Ankit Shah, Saiyra Qureshi, Alex Huang, Connie Miao, Wei Wei

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出REDEREF控制器,通过概率方法提升多代理LLM系统的路由效率与鲁棒性,减少资源消耗并提高任务成功率。

Comments under review, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11223 2026-03-13 cs.CL cs.AI cs.IR 62%

MDER-DR: Multi-Hop Question Answering with Entity-Centric Summaries

MDER-DR: 基于实体中心摘要的多跳问答

Riccardo Campi, Nicolò Oreste Pinciroli Vago, Mathyas Giudici, Marco Brambilla, Piero Fraternali

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MDER-DR通过实体中心摘要和分解解决机制,提升多跳问答任务在稀疏复杂关系数据中的鲁棒性和性能。

Comments Our code is available at https://github.com/DataSciencePolimi/MDER-DR_RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22607 2026-03-11 cs.AI cs.CL 62%

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体

Jiaxuan Gao, Jiaao Chen, Chuyi He, Shusheng Xu, Di Jin, Yi Wu

专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08754 2026-03-11 cs.LG cs.AI 62%

Hindsight Credit Assignment for Long-Horizon LLM Agents

长远时间LLM智能体的回顾信用分配

Hui-Ze Tan, Xiao-Wen Yang, Hao Chen, Jie-Jing Shao, Yi Wen, Yuteng Shen, Weihong Luo, Xiku Du, Lan-Zhe Guo, Yu-Feng Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HCAPO通过整合回顾信用分配提升LLM智能体在长期任务中的探索效率和决策简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14176 2026-03-10 cs.AI cs.LG 62%

ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning

基于基础模型的自动奖励机制:用于组合强化学习的自动化奖励机

Roger Creus Castanyer, Faisal Mohamed, Pablo Samuel Castro, Cyrus Neary, Glen Berseth

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) University of British Columbia(不列颠哥伦比亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ARM-FM通过基础模型实现自动化奖励设计,利用自然语言生成奖励机并实现跨任务泛化,提升强化学习的通用性和效率。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06088 2026-03-09 cs.CL cs.AI 62%

Experiences Build Characters: The Linguistic Origins and Functional Impact of LLM Personality

经验塑造性格:大语言模型人格的语言起源与功能影响

Xi Wang, Mengdie Zhuang, Jiqun Liu

机构 * University of Sheffield(谢菲尔德大学) University of Oklahoma(俄克拉荷马大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过持续预训练和大五人格框架,揭示了大语言模型人格的形成机制,发现模型能力在特定性格类型中表现最佳,并揭示了训练数据语言特征对推理性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04741 2026-03-06 cs.AI cs.DB cs.IR cs.LG 62%

CONE: Embeddings for Complex Numerical Data Preserving Unit and Variable Semantics

CONE:用于复杂数值数据的嵌入方法,保留单位和变量语义

Gyanendra Shrestha, Anna Pyayt, Michael Gubanov

机构 * Florida State University(佛罗里达州立大学) University of South Florida(佛罗里达州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CONE通过复合嵌入方法提升复杂数值数据的语义编码,实现跨领域高精度数值推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18876 2026-03-06 cs.CV cs.AI cs.CL 62%

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏