arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-05 至 2026-01-05 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 26 篇

2601.00003 2026-01-05 cs.AI cs.CL 90%

Reasoning in Action: MCTS-Driven Knowledge Retrieval for Large Language Models

行动中的推理:基于MCTS的知识检索用于大语言模型

Shuqi Liu, Bowei He, Chen Ma, Linqi Song

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于MCTS的知识检索方法,通过增强LLM与对话逻辑结构的对齐,提升多轮对话中的推理能力和响应多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00730 2026-01-05 cs.CV 89%

Grading Handwritten Engineering Exams with Multimodal Large Language Models

用多模态大语言模型评分手写工程考试

Janez Perš, Jon Muhovič, Andrej Košir, Boštjan Murovec

机构 * University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究利用多模态大语言模型对斯洛文尼亚语手写工程考试进行自动评分,通过多阶段设计实现高可靠性,达到与人工评分约8分的均方差,验证了结构化提示和参考定位的重要性。

Comments 10 pages, 5 figures, 2 tables. Supplementary material available at https://lmi.fe.uni-lj.si/en/janez-pers-2/supplementary-material/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00685 2026-01-05 physics.med-ph 88%

Human-like AI-based Auto-Field-in-Field Whole-Brain Radiotherapy Treatment Planning With Conversation Large Language Model Feedback

类人AI驱动的自动场内场全脑放疗治疗计划与对话大语言模型反馈

Adnan Jafar, An Qin, Gavin Atkins, Xiaoyu Hu, Yin Gao, Xun Jia

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);LLM(abstract)

AI总结 本研究提出基于深度学习和大语言模型的自动化全脑放疗计划制定方法,通过对话接口实现交互式优化,提升计划质量和效率。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00121 2026-01-05 cs.AI cs.HC 85%

Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control

提问、澄清、优化:人类-大语言模型代理协作以实现更智能的库存控制

Yaqi Duan, Yichun Hu, Jiashuo Jiang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出混合代理框架,利用LLM作为智能接口,通过分离语义推理与数学计算,降低库存成本32.1%,证明LLM作为自然语言接口使优化策略更易被非专家使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07675 2026-01-05 cs.DB cs.AI 85%

QUITE: A Query Rewrite System Beyond Rules with LLM Agents

QUITE:超越规则的查询重写系统与LLM代理

Yuyang Song, Hanxu Yan, Jiale Lao, Yibo Wang, Yufei Li, Yuanchun Zhou, Jianguo Wang, Mingjie Tang

机构 * Sichuan University(四川大学) Cornell University(康奈尔大学) Purdue University(普渡大学) Hong Kong University of Science and Technology(香港科学与技术大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 QUITE利用LLM代理超越规则,通过多代理框架、中间件和提示注入技术实现更高效的SQL查询重写,提升性能并覆盖更广的查询模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11407 2026-01-05 cs.CL cs.AI 85%

EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes

EXAONE 4.0:整合非推理与推理模式的统一大语言模型

Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Yemuk Choi, Kyubeen Han, Seokhee Hong, Junwon Hwang, Taewan Hwang, Joonwon Jang, Hyojin Jeon, Kijeong Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Euisoon Kim, Hyosang Kim, Jihoon Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Gwangho Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Young Min Paik, Yongmin Park, Youngyong Park, Sanghyun Seo, Sihoon Yang, Heuiyeen Yeen, Sihyuk Yi, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 EXAONE 4.0通过整合非推理与推理模式,实现了高性能与先进推理能力的统一,支持多语言并提供两种不同规模的模型版本。

Comments Technical Report, 30 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00110 2026-01-05 cs.NI 85%

CTMap: LLM-Enabled Connectivity-Aware Path Planning in Millimeter-Wave Digital Twin Networks

CTMap: 基于大语言模型的毫米波数字孪生网络中连接感知的路径规划

Md Salik Parwez, Sai Teja Srivillibhutturu, Sai Venkat Reddy Kopparthi, Asfiya Misba, Debashri Roy, Habeeb Olufowobi, Charles Kim

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CTMAP通过结合数字孪生与大语言模型,实现毫米波网络中连接感知的路径规划,显著提升信号强度并提高导航的可解释性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24504 2026-01-05 cs.AI 79%

Thinking on Maps: How Foundation Model Agents Explore, Remember, and Reason Map Environments

地图上的思考:基础模型代理如何探索、记忆和推理地图环境

Zhiwei Wei, Yuxing Liu, Hua Liao, Wenjia Xu

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出交互式评估框架,分析基础模型代理在符号地图环境中探索、记忆和推理的过程,揭示不同组件在空间理解中的作用。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23328 2026-01-05 cs.AI cs.CL cs.CV 79%

CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations

CubeBench: 在部分观察下诊断交互式、长周期空间推理

Huan-ang Gao, Zikang Zhang, Tianwei Luo, Kaisen Yang, Xinzhe Juan, Jiahao Qiu, Tianxing Chen, Bingxiang He, Hao Zhao, Hao Zhou, Shilong Liu, Mengdi Wang

机构 * THU(清华大学) Princeton(普林斯顿大学) SJTU & UMich(上海交通大学 & 密歇根大学) HKU(香港大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CubeBench通过魔方基准评估LLM在部分观察下的空间推理和长周期任务能力,揭示LLM在长期规划中的根本缺陷。

Comments Webpage: https://cubebench.c7w.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00747 2026-01-05 cs.LG 77%

The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving

推理与创造力的权衡:迈向以创造力为导向的问题解决

Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DCR框架,通过统一变分目标解决LLM在正确性与创造性之间的权衡问题,提供稳定且多样化的训练方法。

Comments 56 pages, 9 figures, submitted to Twenty-Ninth Annual Conference on Artificial Intelligence and Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12524 2026-01-05 cs.CL cs.AI 76%

EXAONE Deep: Reasoning Enhanced Language Models

EXAONE Deep:增强推理能力的语言模型

Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Yemuk Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Kijeong Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Yongmin Park, Sihoon Yang, Heuiyeen Yeen, Sihyuk Yi, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI

AI总结 EXAONE Deep通过训练专用推理数据集,在数学和编码任务中展现出优于同类模型的能力,并提供大模型版本供研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00448 2026-01-05 cs.CL cs.AI 73%

Language as Mathematical Structure: Examining Semantic Field Theory Against Language Games

语言作为数学结构:对语义场理论与语言游戏的检验

Dimitris Vartziotis

机构 * TWT Science & Innovation(TWT科学与创新) NIKI - Digital Engineering(NIKI数字工程)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比语义场理论与语言游戏,探讨语言的数学结构与社会建构的互补性,提出新的理论指导AI架构的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01006 2026-01-05 cs.CV cs.AI cs.LG 73%

GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

GLM-4.5V 和 GLM-4.1V-Thinking:迈向具有可扩展强化学习的多功能推理

V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Haochen Li, Jiale Zhu, Jiali Chen, Jiaxing Xu, Jiazheng Xu, Jing Chen, Jinghao Lin, Jinhao Chen, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Ruiliang Lyu, Shangqin Tu, Sheng Yang, Shengbiao Meng, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wei Jia, Wenkai Li, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyu Zhang, Xinyue Fan, Xuancheng Huang, Yadong Xue, Yanfeng Wang, Yanling Wang, Yanzi Wang, Yifan An, Yifan Du, Yiheng Huang, Yilin Niu, Yiming Shi, Yu Wang, Yuan Wang, Yuanchang Yue, Yuchen Li, Yusen Liu, Yutao Zhang, Yuting Wang, Yuxuan Zhang, Zhao Xue, Zhengxiao Du, Zhenyu Hou, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Zhipu AI & Tsinghua University(智谱AI与清华大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 GLM-4.5V和GLM-4.1V-Thinking通过可扩展强化学习提升多模态推理能力,实现多任务高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25008 2026-01-05 cs.CV 71%

FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM

FoundationSLAM: 释放深度基础模型的力量以实现端到端的密集视觉SLAM

Yuchen Wu, Jiahe Li, Fabio Tosi, Matteo Poggi, Jin Zheng, Xiao Bai

专题命中 推理与问题求解 :foundation model(title)

AI总结 FoundationSLAM通过结合深度基础模型与几何推理,实现端到端的密集视觉SLAM,提升轨迹精度和重建质量,实现实时18 FPS运行。

Comments Accept at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG 70%

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00482 2026-01-05 cs.SE cs.AI 70%

Multi-Agent Coordinated Rename Refactoring

多智能体协同重命名重构

Abhiram Bellur, Mohammed Raihan Ullah, Fraol Batole, Mohit Kansara, Masaharu Morimoto, Kai Ishikawa, Haifeng Chen, Yaroslav Zharov, Timofey Bryksin, Tien N. Nguyen, Hridesh Rajan, Danny Dig

机构 * University of Colorado(科罗拉多大学) Tulane University(路易斯安那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) NEC Corporation(日本电气通信事业株式会社) NEC Laboratories America(NEC美国实验室) JetBrains Research(JetBrains研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多智能体框架,通过协同重命名重构自动化减少开发者负担,提升重构效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00125 2026-01-05 cs.AI 70%

Constructing a Neuro-Symbolic Mathematician from First Principles

从第一原理构建一个神经符号数学家

Keqin Xie

机构 * Keqin Xie

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Mathesis架构,通过神经符号方法将数学状态编码为超图,并利用可微逻辑引擎实现逻辑一致性与能量最小化,以提升复杂推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22149 2026-01-05 cs.DC cs.AI cs.MA 70%

Adaptive GPU Resource Allocation for Multi-Agent Collaborative Reasoning in Serverless Environments

面向无服务器环境的多智能体协作推理自适应GPU资源分配

Guilin Zhang, Wulan Guo, Ziqi Tan

机构 * Department of Engineering Management and Systems Engineering, George Washington University, USA(工程管理与系统工程系,乔治华盛顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自适应GPU资源分配框架,通过动态分配资源降低延迟并提升效率,适用于无服务器环境下的多智能体协作推理任务。

Comments 6 pages, 2 figures

Journal ref 2025 IEEE Computing, Communications and IoT Applications (ComComAP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20144 2026-01-05 cs.CL 70%

Multi-hop Reasoning via Early Knowledge Alignment

通过早期知识对齐实现多跳推理

Yuxin Wang, Shicheng Fang, Bo Wang, Qi Luo, Xuanjing Huang, Yining Zheng, Xipeng Qiu

机构 * Computer Science, Fudan University(复旦大学计算机科学系) Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究所) Shanghai SII(上海SII)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EKA通过早期知识对齐提升多跳推理效率,增强检索精度和系统性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10563 2026-01-05 cs.AI 70%

NormCode: A Semi-Formal Language for Auditable AI Planning

NormCode: 一种用于可审计AI规划的半形式语言

Xin Guan, Yunshan Li, Zekun Wu, Ruibo Zhang

机构 * Center for Long-Term AI(长期人工智能中心) Shenzhen University(深圳大学) University College London(伦敦大学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NormCode是一种半形式语言,通过强制数据隔离和严格区分语义与语法操作,实现AI工作流的可审计性,确保透明性和可验证性。

Comments Archive name: NormCode: A Semi Formal Language for Context Isolated AI Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10684 2026-01-05 cs.CL cs.CY 70%

SpiderGen: Towards Procedure Generation For Carbon Life Cycle Assessments with Generative AI

SpiderGen:面向碳生命周期评估的流程生成方法

Anupama Sitaraman, Bharathan Balaji, Yuvraj Agarwal

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 SpiderGen利用生成式AI生成碳生命周期评估的流程图,准确率达65%,显著降低评估成本和人力投入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00002 2026-01-05 cs.DB 67%

From Metadata to Meaning: A Semantic Units Knowledge Graph for the Biodiversity Exploratories

从元数据到意义:一个语义单元知识图谱用于生物多样性探索

Tarek Al Mustafa

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出语义单元以提升用户与知识图谱的互操作性,并展示如何利用大语言模型和嵌入模型构建结构化、FAIR元数据。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00510 2026-01-05 cs.IR cs.CL 57%

A Chain-of-Thought Approach to Semantic Query Categorization in e-Commerce Taxonomies

基于链式思维的电子商务分类语义查询分类方法

Jetlir Duraj, Ishita Khan, Kilian Merkelbach, Mehran Elyasi

机构 * eBay Inc, USA(eBay公司) eBay Inc, Germany(eBay公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出基于链式思维的电子商务查询分类方法,结合树搜索与LLM语义评分,提升分类准确性和扩展性。

Comments 9 pages, accepted at SIGIR eCom 2025

Journal ref Proceedings of the SIGIR eCom 2025 Workshop, CEUR-WS.org, Vol-4123

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00339 2026-01-05 cs.AI cs.DC cs.ET cs.MA cs.NE 57%

Bio-inspired Agentic Self-healing Framework for Resilient Distributed Computing Continuum Systems

生物启发的代理自修复框架用于鲁棒分布式计算连续系统

Alaa Saleh, Praveen Kumar Donta, Roberto Morabito, Sasu Tarkoma, Anders Lindgren, Qiyang Zhang, Schahram Dustdar, Susanna Pirttikangas, Lauri Lovén

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 ReCiSt通过生物启发的代理自修复框架,实现分布式计算连续系统的快速自我修复与韧性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00142 2026-01-05 cs.AI 57%

An AI Monkey Gets Grapes for Sure -- Sphere Neural Networks for Reliable Decision-Making

一个AI猴子确保能拿到葡萄——用于可靠决策的球神经网络

Tiansi Dong, Henry He, Pietro Liò, Mateja Jamnik

机构 * Phillips Academy Andover(安多弗菲利普斯学术 academy)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出球神经网络,通过在n维球面上嵌入概念,实现可靠决策,能掌握16种三段论任务。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12483 2026-01-05 cs.CR cs.AI 57%

Mage: Cracking Elliptic Curve Cryptography with Cross-Axis Transformers

Mage:利用跨轴变换器破解椭圆曲线密码学

Lily Erickson

机构 * EmerGen LLC

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文利用跨轴变换器探索现代语言模型在破解椭圆曲线密码学中的应用,通过反向工程公钥对生成过程来破解加密算法。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 28 篇

2505.16587 2026-01-05 cs.SE 88%

A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems

面向自动驾驶系统场景化测试的大型语言模型应用综述

Yongqi Zhao, Ji Zhou, Dong Bi, Tomislav Mihalj, Jia Hu, Arno Eichberger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在自动驾驶系统场景化测试中的应用,系统分类了其在不同测试阶段的角色,并总结了关键特性与使用策略,同时指出了五个开放挑战和研究方向。

Comments 24 pages, 11 figures

Journal ref IEEE Transactions on Intelligent Transportation Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12869 2026-01-05 cs.CL cs.AI cs.LG 87%

Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators

通过多个评估者实现语言模型无环偏好评估

Zhengyu Hu, Jieyu Zhang, Zhihan Xiong, Alexander Ratner, Kaize Ding, Ranjay Krishna

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PGED通过多个评估者构建偏好图并去噪,解决LLM偏好评估中的循环问题,提升评估可靠性与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00268 2026-01-05 cs.CL cs.AI 86%

Beyond Perfect APIs: A Comprehensive Evaluation of LLM Agents Under Real-World API Complexity

超越完美API:对LLM代理在现实API复杂性下的全面评估

Doyoung Kim, Zhiwei Ren, Jie Hao, Zhongkai Sun, Lichao Wang, Xiyao Ma, Zack Ye, Xu Han, Jun Yin, Heng Ji, Wei Shen, Xing Fan, Benjamin Yao, Chenlei Guo

机构 * Amazon(亚马逊公司) KAIST(韩国科学技术院) University of Pittsburgh(匹兹堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildAGTEval基准测试,用于评估LLM代理在现实API复杂性下的功能调用能力,发现无关信息复杂性显著降低强LLM性能并影响用户满意度。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04481 2026-01-05 cs.GR cs.AI cs.CL cs.MM 86%

Narrative-to-Scene Generation: An LLM-Driven Pipeline for 2D Game Environments

叙事到场景生成:一种由大语言模型驱动的2D游戏环境生成管道

Yi-Chun Chen, Arnav Jhala

机构 * Yale University(耶鲁大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种由大语言模型驱动的2D游戏环境生成方法,通过时间框架分析和空间谓词提取,实现从叙述到可玩场景的自动化生成。

Comments Camera-ready version of a paper accepted at the AIIDE 2025 Workshop on Experimental AI in Games (EXAG)

详情

展开后加载摘要…

URL PDF HTML 收藏