arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-26 至 2026-01-26 共收录 147 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2510.20304 2026-01-26 cs.CL 70%

Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering

探索生成过程奖励建模在半结构化数据中的应用:表格问答的案例研究

Lei Tang, Wei Zhou, Mohsen Mesgar

机构 * University of Augsburg(奥格斯堡大学) Institut für Maschinelle Sprachverarbeitung, University of Stuttgart(斯图加特大学机械语言处理研究所) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了生成过程奖励模型在表格问答任务中的应用,发现结合文本和代码验证的PRMs能辅助解决方案选择,但泛化能力有限。

Comments Accepted at EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 57%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :prompting(abstract);分类 cs.CL

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13018 2026-01-26 cs.LG q-bio.QM 57%

Escaping Local Optima in the Waddington Landscape: A Two-Stage TRPO-PPO Approach for Single-Cell Perturbation Analysis

摆脱Waddington景观的局部极值:一种用于单细胞扰动分析的两阶段TRPO-PPO方法

Francis Boabang, Samuel Asante Gyamerah

机构 * Department of Mathematics, Toronto Metropolitan University(数学系,多伦多 Metropolitan 大学)

专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种两阶段TRPO-PPO方法,用于单细胞扰动分析,通过改进初始化策略提升模型在数字双胞胎系统中的泛化能力。

Comments 17 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 8 篇

2601.12771 2026-01-26 cs.CL 90%

Who Does This Name Remind You of ? Nationality Prediction via Large Language Model Associative Memory

这个名字让你想起谁?通过大语言模型关联记忆进行国籍预测

Keito Inoshita

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 LAMA通过利用大语言模型的关联记忆能力,有效提升国籍预测任务的准确性,其双代理架构在处理不同知识领域时表现出互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16621 2026-01-26 cs.CL 85%

How Does Personalized Memory Shape LLM Behavior? Benchmarking Rational Preference Utilization in Personalized Assistants

个性化记忆如何塑造大语言模型行为?个性化助手中的理性偏好利用基准测试

Xueyang Feng, Weinan Gan, Xu Chen, Quanyu Dai, Yong Liu

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出RPEval基准,通过分析个性化记忆对LLM行为的影响,引入RP-Reasoner方法,有效缓解非理性个性化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11595 2026-01-26 cs.DC cs.LG cs.SE 81%

Enhancing Model Context Protocol (MCP) with Context-Aware Server Collaboration

增强模型上下文协议(MCP)的上下文感知服务器协作

Meenakshi Amulya Jayanti, X. Y. Han

机构 * University of Chicago(芝加哥大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出CA-MCP,通过引入共享上下文存储提升多智能体系统效率,减少LLM调用次数和响应失败频率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15324 2026-01-26 cs.AI 79%

Prometheus Mind: Retrofitting Memory to Frozen Language Models

Prometheus Mind:为冻结语言模型添加记忆

Mark Wind

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI

AI总结 Prometheus Mind通过11个模块化适配器为冻结的Qwen3-4B模型添加记忆,解决提取、训练、注入和隐藏状态崩溃四个问题,实现94.4%的检索准确率。

Comments 28 pages, corrected some inconsistentsies and some edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16649 2026-01-26 cs.AI 70%

LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents

LUMINA:多轮交互智能体的长视图理解

Amin Rakhsha, Thomas Hehn, Pietro Mazzaglia, Fabio Valerio Massoli, Arash Behboodi, Tribhuvanesh Orekondy

机构 * University of Toronto(多伦多大学) Qualcomm AI Research(高通人工智能研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LUMINA研究通过oracle反事实框架分析多轮交互智能体中各基础能力的重要性,揭示了不同技能在不同环境下的有效性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16238 2026-01-26 cs.SE cs.AI cs.LG 62%

VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents

VibeTensor:由AI代理完全生成的深度学习系统软件

Bing Xu, Terry Chen, Fengzhe Zhou, Tianqi Chen, Yangqing Jia, Vinod Grover, Haicheng Wu, Wei Liu, Craig Wittenbrink, Wen-mei Hwu, Roger Bringmann, Ming-Yu Liu, Luis Ceze, Michael Lightstone, Humphrey Shi

机构 * NVIDIA

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 VibeTensor是首个由AI代理完全生成的深度学习系统软件,实现了PyTorch风格的张量库及CUDA内存管理,展示了AI辅助软件工程的里程碑进展。

Comments Open-source: https://github.com/NVLabs/vibetensor

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-01-26 cs.CL cs.CV 57%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.CL

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16973 2026-01-26 cs.CV 50%

VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents

VisGym: 多模态代理的多样化、可定制化、可扩展环境

Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken Goldberg, XuDong Wang, Ion Stoica, David M. Chan, Sewon Min, Joseph E. Gonzalez

专题命中 长上下文与记忆 :language model(abstract)

AI总结 VisGym通过多样化环境评估多模态代理在多步视觉决策中的表现,揭示模型在长上下文处理和视觉化任务中的局限性。

Comments Project page: https://visgym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 20 篇

2601.16520 2026-01-26 cs.CV cs.AI cs.CL 88%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02846 2026-01-26 cs.LG physics.comp-ph 87%

Towards Reasoning for PDE Foundation Models: A Reward-Model-Driven Inference-Time-Scaling Algorithm

面向PDE基础模型的推理:一种基于奖励模型的推理时扩展算法

Siddharth Mansingh, James Amarel, Ragib Arnab, Arvind Mohan, Kamaljeet Singh, Gerd J. Kunde, Nicolas Hengartner, Benjamin Migliori, Emily Casleton, Nathan A. Debardeleben, Ayan Biswas, Diane Oyen, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于奖励模型的推理时扩展算法,用于提升PDE基础模型在分布外情况下的预测准确性,减少对训练样本和模型规模的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09631 2026-01-26 cs.CL 81%

LLMs Got Rhythm? Hybrid Phonological Filtering for Greek Poetry Rhyme Detection and Generation

LLMs Got Rhythm? 希腊诗歌押韵检测与生成的混合语音过滤

Stergios Chatzikyriakidis, Anastasia Natsina

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出混合语音学算法与LLMs结合,解决希腊诗歌押韵检测与生成问题,通过验证循环提升性能至73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16218 2026-01-26 cs.CL cs.AI 81%

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

M3Kang: 评估视觉-语言模型在多语言多模态数学推理中的表现

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 M3Kang是一个大规模多语言多模态数学推理数据集,用于评估视觉-语言模型在多语言数学推理中的表现,通过基准测试揭示模型在基础数学和图表推理上的不足,并展示多语言技术在多模态设置中的有效性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16853 2026-01-26 cs.AI cs.CL 79%

Reasoning Promotes Robustness in Theory of Mind Tasks

推理促进理论思维任务的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * LIACS, Leiden University(莱顿大学人工智能与计算科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理导向的LLMs在理论思维任务中的鲁棒性,发现其在提示变化和任务扰动中表现更稳定,认为鲁棒性提升源于解决正确问题的能力增强而非新的推理形式。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16458 2026-01-26 cs.SE cs.CR 78%

Bridging Expert Reasoning and LLM Detection: A Knowledge-Driven Framework for Malicious Packages

弥合专家推理与大语言模型检测:一种基于知识的恶意包检测框架

Wenbo Guo, Shiwen Song, Jiaxun Guo, Zhengzi Xu, Chengwei Liu, Haoran Ou, Mengmeng Ge, Yang Liu

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 IntelGuard通过整合专家推理与大语言模型,实现高准确率的恶意包检测,发现54个未报告恶意包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16479 2026-01-26 cs.AI 77%

Doc2AHP: Inferring Structured Multi-Criteria Decision Models via Semantic Trees with LLMs

Doc2AHP: 通过语义树利用LLMs推断结构化的多准则决策模型

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Doc2AHP通过结合AHP原理和LLMs,实现结构化多准则决策模型的高效推断,提升决策模型的逻辑完整性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16447 2026-01-26 cs.CL 77%

Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go

融合专家知识:将人类思维带回围棋游戏

Yichuan Ma, Linyang Li, Yongkang Chen, Peiji Li, Jiasheng Ye, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LoGos通过融合围棋专家知识与通用推理能力,实现了在围棋领域的专业水平表现,展示了自然语言推理和战略决策能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01011 2026-01-26 cs.CL cs.AI 76%

Intention Collapse: Intention-Level Metrics for Reasoning in Language Models

意图坍缩:语言模型推理中的意图级度量

Patricio Vera

机构 * School of Engineering and Applied Science(工程与应用科学学院) George Washington University(乔治·华盛顿大学)

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI

AI总结 研究提出意图级度量用于评估语言模型推理性能,通过意图熵、有效维度和可恢复性分析CoT方法的效果差异。

Comments 41 pages, 8 figures, 6 tables. Code: https://github.com/patriciomvera/intention-collapse-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 75%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16506 2026-01-26 cs.CR cs.AI 70%

SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment

SafeThinker: 通过风险推理深化安全对齐

Xianya Fang, Xianying Luo, Yadong Wang, Xiang Chen, Yu Tian, Zequn Sun, Rui Liu, Jun Fang, Naiqiang Tan, Yuanning Cui, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Didi International Business Group(滴滴国际商务集团) Institute for AI, Tsinghua University(清华大学人工智能研究院) Nanjing University of Information Science & Technology(南京信息科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SafeThinker通过动态分配防御资源,有效提升模型对伪装攻击的防御能力,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 70%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01238 2026-01-26 cs.AI 70%

Towards Open-World Retrieval-Augmented Generation on Knowledge Graph: A Multi-Agent Collaboration Framework

面向知识图谱的开放世界检索增强生成:一种多智能体协作框架

Jiasheng Xu, Mingda Li, Yongqiang Tang, Peijie Wang, Wensheng Zhang

机构 * School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AnchorRAG通过多智能体协作框架,在无需预定义锚实体的情况下提升开放世界检索增强生成的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22255 2026-01-26 cs.AI cs.LG 62%

Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks

思维的形状:当分布比正确性更重要时在推理任务中的表现

Abhranil Chandra, Ayush Agrawal, Arian Hosseini, Sebastian Fischmeister, Rishabh Agarwal, Navin Goyal, Aaron Courville

机构 * University of Waterloo(滑铁卢大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) MILA - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Microsoft Research India(微软印度研究院) Google DeepMind(谷歌DeepMind) Periodic Labs(周期实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 通过训练合成数据集中的链式思考轨迹,即使最终答案错误,也能提升语言模型的推理能力,表明分布比正确性更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 62%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22928 2026-01-26 cs.AI cs.CL 62%

Enhancing Study-Level Inference from Clinical Trial Papers via Reinforcement Learning-Based Numeric Reasoning

通过基于强化学习的数值推理增强临床试验论文的论文级别推断

Massimiliano Pronesti, Michela Lorandi, Paul Flanagan, Oisin Redmond, Anya Belz, Yufang Hou

机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰) Dublin City University(都柏林城市大学) IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过强化学习和数值推理提升临床试验论文的论文级别推断,实现更准确的系统评价自动化。

Comments Accepted at EMNLP 2025 Main Conference. This revision corrects a minor typo in the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16965 2026-01-26 cs.AI 57%

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

空间智能体:基于科学核心概念的地理空间推理

Riyang Bao, Cheng Yang, Dazhou Yu, Zhexiang Tang, Gengchen Mai, Liang Zhao

机构 * Emory University(埃默里大学) Rutgers University(罗格斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 Spatial-Agent通过基于空间信息科学的理论框架,实现了可解释的地理空间推理,优于现有方法并产生可执行的工作流。

Comments 15pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12698 2026-01-26 cs.CL 57%

A Two-Stage GPU Kernel Tuner Combining Semantic Refactoring and Search-Based Optimization

一种结合语义重构和基于搜索的优化的双阶段GPU内核调优器

Qiuyi Qu, Yicheng Sui, Yufei Sun, Rui Chen, Xiaofei Zhang, Yuzhi Zhang, Haofeng Wang, Ge Lan

机构 * NanKai University(南开大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种结合语义重构和基于搜索的双阶段GPU内核调优器,通过模板化和参数优化提升内核性能,实现更稳定和高质量的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 57%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏