arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 902 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 902 篇

2606.13861 2026-06-15 cs.CV 新提交 78%

Temporal Backtracking Search for Test-time Generative Video Reasoning

时间回溯搜索:测试时生成式视频推理

Sejoon Jun, Zheng Ding, Huangyuan Su, Weirui Ye, Yilun Du

机构 * Northeastern University(东北大学) Independent Researcher(独立研究者) Harvard & Kempner(哈佛大学与肯普纳研究所) MIT(麻省理工学院)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12579 2026-06-12 cs.RO 新提交 78%

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation

G-MAPP: 基于GPU加速的多智能体规划与感知用于反应式运动生成

Tanmay Bishnoi, Riddhiman Laha, Tobias Löw, Jose Alex Chandy, Luis F. C. Figueredo, Sami Haddadin

机构 * Department of Electrical, Computer, and Biomedical Engineering, Toronto Metropolitan University(多伦多都会大学电气、计算机与生物医学工程系) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Experiential Robotics, Northeastern University(东北大学体验式机器人研究所) Idiap Research Institute(Idiap 研究所) EPFL(瑞士联邦理工学院洛桑) CHART Group at the School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院 CHART 小组) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出GPU加速的框架,通过并行状态探索和紧密耦合感知-动作循环,实现非结构化环境中的实时反应式运动生成,在7自由度机器人上达到5倍加速并成功避障。

Comments The implementation is available at: https://github.com/chart-research/g-mapp

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7516-7523, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10323 2026-06-10 cs.CR 新提交 78%

Semantic Multi-Agent Intrusion Detection for IoT:Zero-Day and Adversarial Threats with Risk-Aware Reasoning

面向物联网的语义多智能体入侵检测:零日与对抗威胁的风险感知推理

Saeid Jamshidi

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出一种结合语义嵌入与多阶段概率决策融合的语义多智能体入侵检测系统,通过四个智能体协作实现零日攻击和对抗攻击的高效检测,在多个真实物联网数据集上达到95.9%检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08738 2026-06-09 cs.NI cs.RO 新提交 78%

Systems-Level Planning and Coordination of Truck-Drone Collaborative Delivery Networks

卡车-无人机协同配送网络的系统级规划与协调

Didem Cicek, Burak Kantarci

机构 * School of Electrical Engineering and Computer Science at the University of Ottawa(渥太华大学电气工程与计算机科学学院)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对城市最后一英里配送,提出分层规划与协调框架,通过任务编排与智能体同步,实现卡车-无人机协同配送,相比纯卡车模式,总配送时间减少42.4%,能耗降低44.2%。

Comments 6 pages, 4 figures, Accepted to 2026 IEEE HPSR on Network Architectures and Intelligence for Smart Mobility and Autonomous Systems (TRAVERSAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08231 2026-06-09 cs.CV 新提交 78%

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning

多模态基础模型中的测试时扩展:生成与推理的综合调查

Cong Wan, Ying He, Zhongzhan Huang, Hefeng Wu

机构 * Sun Yat-sen University(中山大学)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文首次系统综述多模态基础模型中的测试时扩展(TTS)方法,提出统一分类框架(采样、反馈、搜索三类),总结应用与基准,并讨论未来方向。

Comments Accepted by ACL 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08135 2026-06-09 cs.SE 新提交 78%

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse

TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架

Siyu Nan, Yaling Luo, Jian Wang, Neng Zhang, Bing Li

专题命中 规划推理 :planning(title,abstract)

AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07855 2026-06-09 cs.RO math.OC 新提交 78%

Path Planning Using Deep Deterministic Policy Gradient: A Reinforcement Learning Approach

使用深度确定性策略梯度的路径规划:一种强化学习方法

Qiang Le, Yaguang Yang, Isaac E. Weintraub

机构 * Hampton University(汉普顿大学) Air Force Research Laboratory(空军研究实验室)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出基于深度确定性策略梯度的路径规划方法,将威胁建模为圆形禁行区,通过奖励函数引导智能体学习从状态到动作的映射,找到最大安全起始点集,相比传统最优控制方法速度更快,适用于实时应用。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07486 2026-06-08 eess.SY cs.SY 新提交 78%

OPENPATH: A Supervisor--Specialist Agent System for Personalized, Accessible, and Multi-stop Urban Trip Planning

OPENPATH: 一种用于个性化、无障碍和多站点城市出行规划的监督-专家智能体系统

Ziyang Xiong, He Zong, Zhiyuan Xue, Manxi Wu

专题命中 规划推理 :planning(title,abstract)

AI总结 提出监督-专家多智能体系统OPENPATH,结合LLM解析自然语言与经典算法优化路径,支持个性化偏好、多站点规划和无障碍需求,并用于城市尺度无障碍分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 77%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24597 2026-06-24 cs.CL 新提交 77%

Qwen-AgentWorld: Language World Models for General Agents

Qwen-AgentWorld: 通用智能体的语言世界模型

Yuxin Zuo, Zikai Xiao, Li Sheng, Fei Huang, Jianhong Tu, Yuxuan Liu, Tianyi Tang, Xiaomeng Hu, Yang Su, Qingfeng Lan, Yantao Liu, Qin Zhu, Yinger Zhang, Bowen Yu, Haiquan Zhao, Haiyang Xu, Jianxin Yang, Jiayang Cheng, Junyang Wang, Lianghao Deng, Mingfeng Xue, Tianyi Bai, Yang Fan, Yubo Ma, Yucheng Li, Zeyu Cui, Zhihai Wang, Zhihui Xie, Zhuorui Ye, An Yang, Dayiheng Liu, Jingren Zhou, Ning Ding

机构 * Qwen Team(Qwen团队)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 提出基于语言模型的世界模型Qwen-AgentWorld,通过三阶段训练(CPT、SFT、RL)模拟7个领域的智能体环境,并构建AgentWorldBench基准,实验表明其显著优于现有模型,且能作为环境模拟器和智能体基础模型提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18921 2026-08-20 cs.CL cs.AI 新提交 76%

SMTrap: Cost-Effective DoS Attacks Against Large Reasoning Models via SMT Conflict Guidance

SMTrap:基于SMT冲突引导的针对大型推理模型的高性价比DoS攻击

Jian Yang, Zhenqi Feng, Zhaoyang Yu, Zhaoxin Fan, Kejian Wu, Xiaofeng Wang, Zheng Zhu, Jianjun Huang, Wei You, Bin Liang

专题命中 规划推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本研究提出基于SMT冲突引导的轻量级CPU框架SMTrap,无需模型查询或GPU即可生成高影响力CSP查询,实现强于基线数倍的LRM-DoS攻击,还展示了对应的缓解工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 76%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 规划推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00339 2026-08-04 cs.AI cs.CL 新提交 76%

Bayesian and Motivated Reasoning in AI Agents

AI智能体中的贝叶斯推理与动机推理

Eddie Yang

专题命中 规划推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 该研究发现AI智能体的结论受先验信念影响,相同数值数据因框架不同会得出不同结论,揭示了委托其决策存在依赖未指定先验的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交 75%

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00427 2026-07-02 cs.SE 新提交 75%

BT-APE: A Computationally Light Backtracking Approach to Automatic Prompt Engineering for Requirements Classification

BT-APE: 一种用于需求分类的轻量级回溯自动提示工程方法

Mohammad Amin Zadenoori, Waad Alhoshan, Jacek Dąbrowski, Liping Zhao, Alessio Ferrari

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出轻量级回溯自动提示工程方法BT-APE,通过LLM生成候选、回溯搜索和动态示例选择迭代优化提示,在需求分类任务中以更低计算成本达到与资源密集型方法相当的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15367 2026-06-16 cs.AI cs.CL cs.IR cs.LG 新提交 75%

S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents

S1-DeepResearch:超越搜索,迈向真实世界的长周期研究智能体

Yao Dong, Xinglin Xiao, Liwei Dong, Xinlong Jin, Zhengbo Li, Heng Zhang, Duyun Wang, Nan Xu

机构 * XScience Lab(XScience实验室) Wenge AI(问格人工智能)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出统一轨迹构建范式,结合封闭式问答与开放式探索,通过图基任务构建、智能体轨迹生成和多维验证,合成高质量长链推理轨迹,训练出在20个基准上达到开源最优的32B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02686 2026-07-07 cs.AI cs.LG 新提交 74%

ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability

黑暗中的询问:部分可观测性下的不确定性门控语言模型辅助

Juarez Monteiro, Nathan Gavenski, Guilherme Lima, Francisco Galuppo, Odinaldo Rodrigues, Adriano Veloso

机构 * Kunumi Institute(库努米研究所) King’s College London(伦敦国王学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG;planning(comments)

AI总结 研究部分可观测性下强化学习智能体,指出普通不确定性门控方法失败原因是上下文问题。提出ASK+,为语言模型提供轨迹感知上下文和结构化推理,证明预测熵信号可行,在多环境中取得更好效果,强调提示设计重要性。

Comments Accepted at the IJCAI-ECAI Joint Workshop on Planning for Complex Real-World Applications and Bridging the Gap Between AI Planning and (Reinforcement) Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17928 2026-08-19 cs.MA cs.AI cs.RO 新提交 74%

A Theoretical Framework for Parallel Lifelong MAPF Using Group Decentralized Planning

基于组分散规划的并行终身MAPF理论框架

Alex DeWeese, Jiaoyang Li, Guannan Qu

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 针对L-MAPF问题,本文证明RHCR的近最优性,提出并行规划的GD-RHCR框架,其在扩展智能体规模时仍能保持高吞吐量和低单规划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16663 2026-08-18 cs.DB cs.AI 新提交 74%

Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL

用于可靠企业级文本到SQL的有界语义规划与确定性编译

Yi Ai

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。

Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12915 2026-08-14 cs.DC cs.AI 新提交 74%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09281 2026-08-11 cs.AI 新提交 74%

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

MMArch:基于建筑证据的多模态推理基准测试

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06668 2026-08-10 cs.AI 新提交 74%

Vehicle routing problem using deep reinforcement learning - A case study about truck planning in the industry

基于深度强化学习的车辆路径问题——工业中卡车规划的案例研究

Siliang Lu, Dan Hu, Lili Wu

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) School of Electronic Information and Electrical Engineering(电子信息与电气工程学院) School of Computer Science, Macau University of Science and Technology(澳门科技大学计算机学院)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文以工业卡车规划为案例,针对三个物流场景,提出基于深度强化学习的车辆路径优化方法,其优化后路径总成本较基线降低10%以上,还提出可将该算法推广至更多VRP变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00320 2026-08-04 cs.LG cs.MA cs.SY eess.SY 新提交 74%

Neural operator learning for collision-aware trajectory planning of spacecraft swarms

面向航天器集群碰撞感知轨迹规划的神经算子学习

Sidhdharth D. Sikka, Suyi Gao, Zehui Lu, Rongjie Lai, Shaoshuai Mou

机构 * Purdue University(普渡大学) Manifold Research Group(流形研究组)

专题命中 规划推理 :planning(title);分类 cs.LG

AI总结 该研究提出排列等变神经算子,结合自监督物理目标与对抗威胁训练,实现航天器集群轨迹规划,可零样本泛化到大规模集群,精度接近最优控制求解器,性能优于无碎片感知基线。

Comments 27 pages, 6 figures, 6 tables. Submitted to Nature Machine Intelligence. Video abstract included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 74%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22643 2026-07-28 cs.AI cs.CV 新提交 74%

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

检索前先思考:多模态检索增强生成的智能体规划

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

机构 * Bosch AI Research Center(博世人工智能研究中心) University of Notre Dame(圣母大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 研究多模态检索增强生成问题,提出MM-R2框架,通过建模检索内容和位置在检索前推理,构建意图基础检索状态,在结构化知识图谱检索,还构建相关数据集并采用两阶段后训练策略,实验证明其在答案准确性等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 74%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15367 2026-07-20 cs.AI 新提交 74%

AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery

AnovaX:一个具有大语言模型规划、类型化执行器和自适应恢复功能的本地多智能体语音助手

Raunak B Sinha

机构 * BITS Pilani(贝拉理工学院皮拉尼分校)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 研究桌面语音助手局限,提出AnovaX本地多智能体语音助手,通过Python进程连接多组件,含规划器、安全层等,各工具对应专用智能体类,有递归元智能体及自适应恢复循环,还介绍配套服务器功能,展示其独特优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15862 2026-06-23 cs.AI 新提交 74%

RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments

RetailBench: 在真实零售环境中评估LLM代理的长期推理与连贯决策能力

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 提出RetailBench基准,模拟单店超市运营,评估LLM代理在长期决策中的表现,发现多数模型无法持续生存,与最优策略差距显著。

Comments The submission of this paper was a mistake. This is the second version of arXiv:2603.16453, so it should have replaced the original 2603 version through a replacement submission, rather than being published as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10694 2026-06-10 cs.CL 新提交 74%

REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs

REAL: 一种增强推理的图框架用于LLM的长期记忆管理

Keer Lu, Liwei Chen, Guoqing Jiang, Zhiheng Qin, Yunhuai Liu, Wentao Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Kuaishou Technology(快手科技) Center for Data Science, Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院数据科学中心)

专题命中 规划推理 :reasoning(title);分类 cs.CL

AI总结 提出REAL框架,通过构建时序和置信度感知的有向属性图,采用非破坏性更新和混合束搜索检索,解决LLM长期记忆中的关系缺失、事实覆盖和查询被动问题,平均性能提升22.72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12125 2026-08-13 cs.GT cs.AI cs.CL cs.MA 新提交 73%

Do LLMs Take Care of Their Own? Similarity Signals Can Induce Cooperation

大语言模型会照顾同类吗?相似性信号可诱导合作

Akash Kundu, Emanuel Tewolde, Ratip Emin Berker, Samuel F. Brown, Vincent Conitzer

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个带分级相似性信号的LLM决策评估框架,发现不同LLM应对相似性信号差异大、数据集对诱导合作影响小等,构建的LLM-行为博弈论模型可在高相似性下支持合作均衡。

Comments 41 pages, 18 Figures, 4 Tables, 16 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏