arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19063 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19063 篇

2608.23493 2026-08-25 cs.AI 新提交 77%

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

SRPO:用于长程推理的自反思策略优化

Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23029 2026-08-25 cs.CL 新提交 77%

Meta-Moderator: Empowering Multi-Agent Debate with Meta-Cognition

元审核员:用元认知赋能多智能体辩论

Wentao Hu, Zhuoyue Wan, Jinhao Shen, Chen Jason Zhang, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究提出Meta-Moderator可学习框架,将多智能体辩论的审核视为元认知过程,经结果驱动策略优化训练,在五个基准测试中性能优于现有决策层,能动态调控辩论并减少错误聚合。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 77%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22332 2026-08-25 cs.CL 新提交 77%

Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching

通过顺序激活补丁的思维链推理的机制可解释性

Murat Dura, Serkan Öztürk, Selma Tekir

机构 * İzmir Institute of Technology(伊兹密尔理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出顺序激活补丁框架及顺序多头补丁,探究思维链推理的因果效应位置与相关注意力头,证实存在支持思维链的分布式推理子电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21614 2026-08-25 cs.AI cs.DC 新提交 77%

SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning

SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理

Yujie Zhang, Bin Gao, Tulika Mitra

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。

Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21049 2026-08-24 cs.CR cs.AI cs.NI 新提交 77%

$Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN

$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制

Sunder Ali Khowaja, Kapal Dev, George C. Alexandropoulos

机构 * School of Computer Science, Dublin City University(都柏林城市大学计算机科学学院) Munster Technological University(芒斯特理工大学) National and Kapodistrian University of Athens(雅典国立与卡波迪斯特里亚大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20564 2026-08-24 cs.AI 新提交 77%

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

Consilience:用于隐式多智能体推理的保形校准通信控制

Abhijith Babu, Ramneet Kaur, Vishal Pramanik, Olivera Kotevska, Nathaniel D. Bastian, Susmit Jha, Sunny Raj, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) SRI International(SRI国际公司) University of Florida(佛罗里达大学) Oak Ridge National Laboratory(橡树岭国家实验室) Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) Oakland University(奥克兰大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。

Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14178 2026-08-20 cs.AI cs.MA 版本更新 77%

ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System

ReasFlow:通过基于知识的多智能体系统助力应用数学中以推理为中心的科学发现

Yutong He, Daibo Li, Guohong Li, Jiahe Geng, Zhengyang Huang, Can Ren, Zekun Zhang, Yifan Liu, Shuchen Zhu, Hengrui Zhang, Boao Kong, Ming Sun, Shu Li, Chenyi Li, Jiang Hu, Kun Yuan, Zaiwen Wen, Pingwen Zhang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对理论驱动科学发现探索不足的问题,ReasFlow引入以推理为中心的自主智能体系统,通过内部验证循环和知识检索机制减少专家干预,能统一多项科研任务,从最少提示生成高质量论文,在开源基线中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12982 2026-08-19 cs.AI cs.MA cs.SC 版本更新 77%

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

形式分析几何:一种基于神经符号的多模态解析几何问题生成框架

Ruoran Xu, Wending Gao, Xiaoqing Kang, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00417 2026-08-19 cs.NI cs.AI 77%

AgentxGCore: Agentic AI for Next-Generation Mobile Core Network

AgentxGCore:面向下一代移动核心网络的智能体AI

Maria Katarine Santana Barbosa, Kelvin L. Dias

机构 * Centro de Informática - Universidade Federal de Pernambuco(计算机中心 - 佩鲁巴科联邦大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgentxGCore,通过智能体AI原生层扩展3GPP架构,利用多智能体系统实现基于实时信息的闭环优化,支持自组织和自适应。

Comments This paper has been accepted for publication in IEEE Network

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16742 2026-08-18 cs.SE cs.AI 新提交 77%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

机构 * National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Qingdao Research Institute and Hangzhou Innovation Institute, Beihang University(北京航空航天大学青岛研究院与杭州创新研究院) School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15445 2026-08-18 cs.AI 新提交 77%

Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization

测量位置混淆优化下的奖励黑客行为与推理-答案解耦

Suyash Maniyar, Armaan Sandhu, Abhishek Mishra

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。

Comments Accepted at the AI Measurement Science Workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 77%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(summary_cn);prompting(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10840 2026-08-14 cs.LG 版本更新 77%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12358 2026-08-13 cs.CV cs.AI cs.RO 77%

From Prompts to Pavement: LMMs-based Agentic Behavior-Tree Generation Framework for Autonomous Vehicles

从提示到道路:基于大语言模型的代理行为树生成框架用于自动驾驶车辆

Omar Y. Goba, Ahmed Y. Gado, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大·冯·洪堡大学(开罗分校)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室(车辆系统中的认知驾驶研究),开罗,埃及) IAV GmbH, Berlin, Germany(IAV GmbH,柏林,德国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型和多模态视觉模型的代理行为树生成框架,用于自动驾驶车辆在复杂环境中自适应导航。该框架通过链式符号提示评估场景关键性,通过上下文学习构建高层子目标,并通过生成器合成可执行的BT子树,实现了在CARLA+Nav2模拟中对突发障碍物(如道路堵塞)的成功绕行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09790 2026-08-12 cs.AI cs.MA cs.SI 版本更新 77%

CARD: Controlled Agentic Reddit Discussions for Credit Card Simulation

CARD:用于信用卡模拟的受控智能体Reddit讨论框架

Yaoning Yu, Kai-Min Chang, Ye Yu, Yi-Chia Wang, Haojing Luo, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) U.S. Bank(美国银行) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究提出CARD框架,通过规划器、生成器与校准循环,结合多维度控制项生成逼真信用卡讨论线程,经多指标评估,其效果优于多种LLM模拟基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06772 2026-08-12 cs.AI cs.HC hep-ph hep-th 版本更新 77%

When Does Critique Improve AI-Assisted Theoretical Physics? SCALAR: Structured Critic--Actor Loop for Agentic Reasoning

当批评如何提升AI辅助理论物理?SCALAR:用于代理推理的结构化批评-代理循环

Vasilis Niarchos, Constantinos Papageorgakis, Alexander G. Stapleton, Sokratis Trifinopoulos

机构 * Department of Physics, CCTP ITCP, University of Crete, 71303, Greece Centre for Theoretical Physics, Department of Physics Astronomy, Queen Mary University of London, London E1 4NS, United Kingdom Theoretical Physics Department, CERN, Geneva, Switzerland

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了研究人员与代理交互对AI辅助理论物理研究的影响,通过SCALAR框架评估不同交互结构对科学发现的促进作用。

Comments V2. Expanded experiments. Accepted at ICML 2026 Workshop (AI4Physics); 18 pages; 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08935 2026-08-11 cs.AI 新提交 77%

Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis

用于检索增强推理、物体感知与损伤分析的集成多模态AI系统

Kalelo Dukuray, Israel Pina, Evan Perez, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08069 2026-08-11 cs.SE cs.AI 新提交 77%

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

HugSelect:一种用于基础模型选择的可解释多标准决策支持框架

Alireza Joonbakhsh, Arda Canser Adalı, Slinger Jansen, Farshad Khunjush, Siamak Farshidi

机构 * Shiraz University(设拉子大学) Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 HugSelect是用于基础模型选择的可解释多标准决策支持框架,构建含71274个模型的知识库,经多维度评估,推荐质量与商业系统相当,推理可追溯且实用直观。

Comments Pages: 29, Figures: 5. Corresponding authors: Alireza Joonbakhsh (alireza.joonbakhsh@hafez.shirazu.ac.ir) and Siamak Farshidi (siamak.farshidi@wur.nl)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06938 2026-08-10 cs.CV cs.AI 新提交 77%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06292 2026-08-07 cs.CL cs.SC 新提交 77%

NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

NeSy-RAG:用于可解释问答的神经符号检索增强生成框架

Jonas Gann, Michael Gertz

机构 * Heidelberg University(海德堡大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05254 2026-08-07 cs.CL cs.SC 新提交 77%

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。

Comments 53 pages, 5 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31134 2026-08-07 cs.AI 版本更新 77%

Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics

超越图书馆:用于自动形式化研究数学的智能体框架

Arshia Soltani Moakhar, Iman Gholami, Max Springer, Mahdi JafariRaviz, MohammadTaghi Hajiaghayi

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于通用编码大语言模型的智能体自动形式化框架,通过多智能体管道和辅助引理技术,成功形式化了PutnamBench和STOC论文中的主要定理,其中两个证明无需额外公理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04646 2026-08-06 cs.CL 新提交 77%

Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

评估推理模型中的心理理论:推理的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * Leiden University(莱顿大学) LIACS(莱顿高级计算机科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究考察经强化学习训练的推理LLMs在ToM任务中的表现,发现其对提示与任务扰动的鲁棒性提升,支持鲁棒性解释而非ToM特有的新能力。

Comments Accepted for 29th International Conference on Discovery Science, October 5-9, 2026, Mainz, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04311 2026-08-06 cs.CL 新提交 77%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings

并非双关:基于对比学习与音义嵌入的多智能体文字游戏翻译

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究结合大型语言模型与语言约束,提出三种双关语翻译方法,其多智能体系统在CLEF JOKER 2025竞赛中获专家评估第一,可改善文字游戏翻译效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 77%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07666 2026-08-04 cs.CR cs.AI 版本更新 77%

SoK: DARPA's AI Cyber Challenge (AIxCC): Competition Design, Architectures, and Lessons Learned

SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训

Cen Zhang, Younggi Park, Fabian Fleischer, Yu-Fu Fu, Jiho Kim, Dongkwan Kim, Youngjoon Kim, Qingxiao Xu, Andrew Chin, Ze Sheng, Hanqing Zhao, Michael Pelican, David J. Musliner, Jeff Huang, Jon Silliman, Mikel Mcdaniel, Jefferson Casavant, Isaac Goldthwaite, Nicholas Vidovich, Matthew Lehman, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德克萨斯大学) Smart Information Flow Technologies (SIFT)(智能信息流技术公司) Kudu Dynamics(Kudu动态公司) Microsoft(微软)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。

Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01862 2026-07-29 cs.MA cs.AI cs.NI 版本更新 77%

RadioMaster: Multi-Agent System for Autonomous Radio Signal Generation

RadioMaster: 自主无线电信号生成的多智能体系统

Jiazhen Lei, Yuxin Sha, Tianze Cao, Sihan Wang, Bingbing Wang, Zeming Yang, Fengyuan Zhu, Xiaohua Tian

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RadioMaster,一个全自主的多智能体框架,通过RadioWiki、RadioAgent和RadioEmulator三大支柱,将用户意图转化为真实无线信号,解决现有模型因领域知识和硬件约束敏感性不足而无法生成无线电信号的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16780 2026-07-29 cs.IR cs.AI cs.HC 版本更新 77%

Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook

比较RAG和GraphRAG在数学教科书页面级检索问答中的应用

Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在本科数学教科书页面级问答中比较RAG和GraphRAG,用477个问答对数据集在检索准确率和答案质量两指标上对比五个RAG模型、BM25基线及GraphRAG,发现基于嵌入的RAG更优,还通过开源模型复制实验,为AI辅导系统设计提供参考。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22947 2026-07-28 cs.AI cs.MA cs.NI cs.SC 新提交 77%

Let AI Agents Translate Networks, Not Reason About Them

让人工智能代理翻译网络,而非对其进行推理

Hongyu Hè, Maria Apostolaki

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对生产网络缺乏形式模型的问题,提出将人工智能局限于网络工件到形式逻辑规则的翻译,依靠求解器推理,构建TypoNet验证模拟广域网符号模型,能快速可靠回答操作问题及促进故障定位。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏