arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-02 至 2026-03-02 共收录 180 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2602.23438 2026-03-02 cs.CV cs.AI 57%

DesignSense: A Human Preference Dataset and Reward Modeling Framework for Graphic Layout Generation

DesignSense: 一种用于图形布局生成的人类偏好数据集和奖励建模框架

Varun Gopal, Rishabh Jain, Aradhya Mathur, Nikitha SR, Sohan Patnaik, Sudhir Yarram, Mayur Hemani, Balaji Krishnamurthy, Mausoom Sarkar

机构 * MDSR, Adobe(MDSR,Adobe)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 DesignSense通过人类偏好数据集和奖励建模框架提升图形布局生成的质量和效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 7 篇

2508.01832 2026-03-02 cs.CL 89%

MLP Memory: A Retriever-Pretrained Memory for Large Language Models

MLP Memory: 一种用于大语言模型的检索预训练记忆

Rubin Wei, Jiaqi Cao, Jiarui Wang, Jushi Kai, Qipeng Guo, Bowen Zhou, Zhouhan Lin

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 MLP Memory通过参数化学习检索模式,提升大语言模型的知识访问效率与准确性,实现更高效的推理和更少的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23320 2026-03-02 cs.LG cs.MA 79%

ParamMem: Augmenting Language Agents with Parametric Reflective Memory

ParamMem: 通过参数化反思记忆增强语言代理

Tianjun Yao, Yongqiang Chen, Yujia Zheng, Pan Li, Zhiqiang Shen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.LG

AI总结 ParamMem通过参数化记忆模块提升语言代理的反思多样性,实现更高效的推理和跨任务迁移能力。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23370 2026-03-02 cs.CL cs.AI cs.IR 73%

Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents

迈向通用语义分块:一种适用于超长文档的判别框架

Kaifeng Wu, Junyan Wu, Qiang Liu, Jiarui Zhang, Wen Xu

机构 * KingSoft Office Zhuiguang AI Lab(金山办公曙光人工智能实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Qwen3-0.6B的判别分割模型,通过跨窗口上下文融合和重叠滑动窗口策略,实现超长文档的高效段落边界检测,并提升下游检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23944 2026-03-02 cs.CL 70%

MemEmo: Evaluating Emotion in Memory Systems of Agents

MemEmo:评估智能体记忆系统中的情感

Peng Liu, Zhen Tao, Jihao Zhao, Ding Chen, Yansong Zhang, Cuiping Li, Zhiyu Li, Hong Chen

机构 * School of Information, Renmin University of China(中国人民大学信息学院) China Telecom Research Institute(中国电信研究院) MemTensor (Shanghai) Technology(MemTensor(上海)科技)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemEmo提出情感增强的记忆评估基准,通过HLME数据集评估记忆系统在情感信息处理上的性能,揭示当前系统在处理情感记忆方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23937 2026-03-02 cs.RO cs.CV 67%

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24281 2026-03-02 cs.LG cs.AI 62%

Memory Caching: RNNs with Growing Memory

记忆缓存:具有增长记忆的RNNs

Ali Behrouz, Zeman Li, Yuan Deng, Peilin Zhong, Meisam Razaviyayn, Vahab Mirrokni

机构 * Google(谷歌)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Memory Caching技术,通过缓存RNN的记忆状态以增强其记忆容量,实现与Transformer的平衡性能,在长上下文任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23962 2026-03-02 eess.IV cs.CV 50%

Extending 2D foundational DINOv3 representations to 3D segmentation of neonatal brain MR images

将2D基础DINOv3表示扩展到新生儿脑部MRI图像的3D分割

Annayah Usman, Behraj Khan, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出了一种基于结构化窗口分解-重组机制的方法,利用冻结的2D基础表示扩展到3D分割,实现了对新生儿脑部MRI图像的高精度分割。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 41 篇

2602.23656 2026-03-02 cs.CL cs.AI 91%

TRIZ-RAGNER: A Retrieval-Augmented Large Language Model for TRIZ-Aware Named Entity Recognition in Patent-Based Contradiction Mining

TRIZ-RAGNER: 一种用于基于专利矛盾挖掘的TRIZ-aware命名实体识别的检索增强型大语言模型

Zitong Xu, Yuqing Wu, Yue Zhao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 TRIZ-RAGNER通过整合TRIZ知识和检索增强技术,提升专利矛盾挖掘中命名实体识别的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23668 2026-03-02 cs.AI cs.SY eess.SY 89%

PseudoAct: Leveraging Pseudocode Synthesis for Flexible Planning and Action Control in Large Language Model Agents

PseudoAct: 通过伪代码合成实现大型语言模型代理的灵活规划与动作控制

Yihan, Wen, Xin Chen

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 PseudoAct通过伪代码合成实现LLM代理的灵活规划与动作控制,提升长时决策效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24172 2026-03-02 cs.CL cs.AI 88%

ArgLLM-App: An Interactive System for Argumentative Reasoning with Large Language Models

ArgLLM-App:基于大语言模型的论证推理交互系统

Adam Dejl, Deniz Gorur, Francesca Toni

机构 * Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ArgLLM-App是一个基于大语言模型的论证推理交互系统,通过可视化解释和用户交互实现决策的可解释性和可挑战性。

Comments AAMAS 2026 Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23792 2026-03-02 cs.CL 88%

Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding

分而治之:通过自适应并行解码加速扩散式大语言模型

Xiangzhong Luo, Yilin An, Zhicheng Yu, Weichen Liu, Xu Yang

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 DiCo通过分而治之的自适应并行解码方法,提升扩散式大语言模型的推理速度并保持生成质量。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23610 2026-03-02 cs.CL cs.AI 88%

LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning

基于大语言模型的多轮任务导向对话合成用于真实推理

Yu Zhu, Kai Yang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出基于LLM的多轮任务导向对话合成框架,通过三级优化生成真实推理场景下的对话,提升LLM的逻辑推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24945 2026-03-02 cs.CL cs.AI 88%

MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes

MobileLLM-R1: 探索子十亿参数语言模型推理能力的极限与开放训练配方

Changsheng Zhao, Ernie Chang, Zechun Liu, Chia-Jung Chang, Wei Wen, Chen Lai, Sheng Cao, Yuandong Tian, Raghuraman Krishnamoorthi, Yangyang Shi, Vikas Chandra

机构 * Meta AI

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 MobileLLM-R1通过开放训练配方在较少数据下实现子十亿参数模型的推理能力突破,显著超越现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19364 2026-03-02 cs.AI cs.MA 87%

Integrating LLM in Agent-Based Social Simulation: Opportunities and Challenges

将大语言模型整合到基于代理的社会模拟中:机遇与挑战

Patrick Taillandier, Jean Daniel Zucker, Arnaud Grignard, Benoit Gaudou, Nghi Quang Huynh, Alexis Drogoul

机构 * UR MIAT, University of Toulouse, INRAE, Castanet-Tolosan, France(法国图卢兹大学UR MIAT,INRAE,Castanet-Tolosan分校) UMI 209 UMMISCO, IRD/Sorbonne University, Bondy, France(法国Bondy IRD/索邦大学UMI 209 UMMISCO) LMI ACROSS, Thuyloi University, Hanoi, Vietnam(越南胡志明大学LMI ACROSS) UMR 5505 IRIT, University of Toulouse Capitole, Toulouse, France(法国图卢兹大学Capitole UMR 5505 IRIT) CICT, Can Tho University, Can Tho, Vietnam(越南金瓯大学CICT)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文探讨了大语言模型在社会模拟中的应用,分析其潜力与局限,并提出混合宪法架构作为整合LLM与传统代理模型的可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23556 2026-03-02 cs.LG cs.AI cs.DC cs.MA cs.PF 86%

Rudder: Steering Prefetching in Distributed GNN Training using LLM Agents

Rudder: 在分布式GNN训练中利用LLM代理进行转向预取

Aishwarya Sarkar, Sayan Ghosh, Nathan Tallent, Aman Chadha, Tanya Roosta, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Pacific Northwest National Laboratory(太平洋西北国家实验室) Amazon GenAI(亚马逊生成人工智能) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Rudder利用LLM代理的生成式AI能力,通过自适应预取减少分布式GNN训练中的通信开销,提升训练性能达91%。

Comments Accepted to the 40th ACM International Conference on Supercomputing (ICS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 86%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title)

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23777 2026-03-02 cs.AI 85%

Reasoning-Driven Multimodal LLM for Domain Generalization

基于推理的多模态大语言模型用于领域泛化

Zhipeng Xu, Zilong Wang, Xinyang Jiang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) National Engineering Laboratory for Integrated Aero-Space-Ground- Ocean Big Data Application(国家一体化空天地海大数据应用工程实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RD-MLDG框架,利用多模态大语言模型的推理能力,通过引入多任务交叉训练和自我对齐的推理正则化,提升领域泛化性能。

Comments Accepted at ICLR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23719 2026-03-02 cs.RO cs.AI 85%

SAGE-LLM: Towards Safe and Generalizable LLM Controller with Fuzzy-CBF Verification and Graph-Structured Knowledge Retrieval for UAV Decision

SAGE-LLM:面向安全且可泛化的LLM控制器,结合模糊-CBF验证和图结构知识检索用于无人机决策

Wenzhe Zhao, Yang Zhao, Ganchao Liu, Zhiyu Jiang, Dandan Ma, Zihao Li, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安 710072,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SAGE-LLM通过模糊-CBF验证和图结构知识检索,提升无人机决策的安全性和泛化能力,无需在线训练即可在复杂环境中保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23681 2026-03-02 cs.AI 85%

ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference

ODAR:通过主动推断实现LLM推理的原理性自适应路由

Siyuan Ma, Bo Gao, Xiaojun Jia, Simeng Qin, Tianlin Li, Ke Ma, Xiaoshuang Jia, Wenqi Ren, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Northeast University (Qinhuangdao Campus)(东北大学(秦皇岛校区)) Beihang University(北航) University of the Chinese Academy of Sciences(中国科学院大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ODAR通过主动推断实现LLM推理的原理性自适应路由,优化精度-效率权衡,提升计算匹配下的准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23729 2026-03-02 cs.CL cs.AI cs.LG 85%

From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning

从静态基准到动态协议:面向评估LLM推理能力的代理中心文本异常检测

Seungdong Yoa, Sanghyu Yoon, Suhee Yoon, Dongmin Kim, Ye Seul Sim, Junhyun Lee, Woohyung Lim

机构 * LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种动态协议,通过代理中心文本异常检测评估LLM推理能力,以克服静态数据集的局限性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23225 2026-03-02 cs.CL cs.AI 84%

Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?

为何扩散语言模型在真正并行(非自回归)解码中表现不佳?

Pengxiang Li, Dilxat Muhtar, Tianlong Chen, Lu Yin, Shiwei Liu

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) ELLIS Institute Tübingen, Tübingen, Germany(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心) University of Surrey, Guildford, United Kingdom(萨里大学) The University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NAP方法,通过数据驱动策略改进扩散语言模型的非自回归并行解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23234 2026-03-02 cs.AI cs.CL 84%

p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

p-less采样:一种无需超参数的LLM解码方法

Runyan Tan, Shuang Wu, Phillip Howard

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 p-less采样是一种无需超参数的LLM解码方法,通过动态截断阈值提高生成质量并减少温度对文本质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22465 2026-03-02 cs.AI 83%

ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization

ConstraintBench: 对直接优化的LLM约束推理进行基准测试

Joseph Tso, Preston Schmittou, Quan Huynh, Jibran Hutchins

机构 * Haladir Research Team(Haladir研究团队)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ConstraintBench评估LLM在约束优化任务中的直接推理能力,发现可行性是主要瓶颈,最佳模型仅达65%可行性,但可行解接近最优解。

Comments Preprint. 10 pages, 1 figure, 6 tables. Benchmark and evaluation code will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24111 2026-03-02 cs.CV cs.AI cs.CL cs.LO 81%

Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification

通过形式验证为视觉语言模型中的临床推理提供保证

Vikash Singh, Debargha Ganguly, Haotian Yu, Chengwei Zhou, Prerna Singh, Brandon Lee, Vipin Chaudhary, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过形式验证框架,为视觉语言模型的临床推理提供保证,验证诊断主张的数学推导性,提升生成临床助手的正确性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11556 2026-03-02 cs.LG cs.AI cs.CL cs.SD eess.AS 80%

CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning

CSyMR:在符号音乐推理中进行组合音乐信息检索的基准测试

Boyang Wang, Yash Vishe, Xin Xu, Zachary Novack, Xunyi Jiang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CSyMR-Bench通过工具增强的检索和推理框架,在符号音乐推理中实现组合音乐信息检索的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25992 2026-03-02 cs.CL cs.AI cs.LG 80%

Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning

监督强化学习:从专家轨迹到逐步推理

Yihe Deng, I-Hung Hsu, Jun Yan, Zifeng Wang, Rujun Han, Gufeng Zhang, Yanfei Chen, Wei Wang, Tomas Pfister, Chen-Yu Lee

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SRL框架,通过生成逻辑动作序列提升小模型的多步推理能力,结合监督与强化学习实现更有效的训练。

Comments Paper accepted by ICLR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 79%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08016 2026-03-02 cs.CV cs.AI 79%

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

FRIEDA:评估视觉语言模型中多步骤制图推理的基准

Jiyoon Pyo, Yuankun Jiao, Dongwon Jung, Zekun Li, Leeje Jang, Sofia Kirsanova, Jina Kim, Yijun Lin, Qin Liu, Junyi Xie, Hadi Askari, Nan Xu, Muhao Chen, Yao-Yi Chiang

机构 * University of Minnesota-Twin Cities(明尼苏达大学双城分校) University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 FRIEDA 是一个评估视觉语言模型多步骤制图推理能力的基准,通过多步骤推理和跨地图定位测试,揭示了当前模型在空间智能方面的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00060 2026-03-02 cs.CV cs.AI cs.RO 79%

Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving

少即是多:一种高效而强大的视觉-语言模型用于自动驾驶

Sheng Yang, Tong Zhan, Guancheng Chen, Yanfeng Lu, Jian Wang

机构 * School of Data Science, Fudan University Shanghai, China(复旦大学数据科学学院) Institute of Automation, Chinese Academy of Sciences Beijing, China(中国科学院自动化研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出Max-V1模型,通过端到端视觉-语言方法实现高效自动驾驶,取得nuScenes数据集上的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏