AMAP Agentic Planning Technical Report
AMAP 代理规划技术报告
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI
AI总结 STAgent是一种专门用于时空理解的代理大语言模型,通过稳定工具环境、分层数据筛选和级联训练配方,有效解决复杂任务并保持通用能力。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
AMAP 代理规划技术报告
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI
AI总结 STAgent是一种专门用于时空理解的代理大语言模型,通过稳定工具环境、分层数据筛选和级联训练配方,有效解决复杂任务并保持通用能力。
置信度估计何时决定大语言模型需要链式推理
机构 * School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 研究通过置信度门控CoT技术,探讨如何根据置信度估计决定是否需要链式推理,以优化大语言模型的计算资源使用。
Comments Under Review
Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索
机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) ; Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。
消费者聊天机器人能推理吗?一个嵌入
机构 * George Mason University(乔治·马歇尔大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过学生主导的实地实验,评估了消费者聊天机器人在推理任务中的表现,揭示了其在不同推理类型上的性能差异及教学意义。
Agent+P: 通过符号规划引导UI代理
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 AGENT+P通过符号规划引导UI代理,提升UI自动化任务的成功率和效率。
鲁棒推理作为对称保护的拓扑相
机构 * Science and Technology Directorate, Department of Homeland Security(国土安全部科学技术管理局)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出鲁棒推理是一种对称保护的拓扑相,通过非阿贝尔规范对称性实现逻辑运算的拓扑不变性,展示了在高噪声环境下保持逻辑一致性的能力。
未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性
机构 * African Institute for Mathematical Science(非洲数学科学研究所) ; University of Vienna(维也纳大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。
无复杂度偏见的思维递归分解
机构 * Southwest Jiaotong University(西南交通大学) ; Southwestern University of Finance and Economics(西南财经大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 CARD通过预估问题复杂度并递归分解提升多步推理的准确性和效率
Comments 4
几何推理的里程碑:通过子目标可验证奖励解锁几何推理
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology Beijing(北京科技大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。
T-Retriever:基于树的分层检索增强生成用于文本图谱
机构 * BRAIN of RUC(北京理工大学脑科学研究院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 T-Retriever通过语义和结构引导的树状检索方法,改进了图谱检索增强生成,提升复杂查询的连贯性和语境相关性。
超越单一架构:一种多智能体搜索与知识优化框架用于智能搜索
机构 * Renmin University of China(中国人民大学) ; Baidu Inc.(百度公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 M-ASK提出了一种多智能体框架,通过分解智能搜索为搜索行为和知识管理两个角色,提升搜索效率与稳定性,实现更优的答案准确性和训练动态。
GUITester: 使GUI代理用于探索性缺陷发现
机构 * Beijing Jiaotong University(北京交通大学) ; Hithink Research(慧思科技) ; Nanyang Technological University(南洋理工大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。
Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。
通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡
机构 * UC Santa Barbara(加州大学圣芭芭拉分校) ; MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) ; Adobe Research(Adobe研究院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。
当前智能体无法利用世界模型作为前瞻性工具
机构 * UIUC(伊利诺伊大学香槟分校) ; THU(清华大学) ; JHU(约翰霍普金斯大学) ; Columbia(哥伦比亚大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。
Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)
Sci-Reasoning:一个解码AI创新模式的数据集
机构 * Orchestra Research(Orchestra研究)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 Sci-Reasoning数据集通过分析AI研究中的15种思维模式,揭示了高影响力论文的创新机制,为训练下一代AI研究代理提供结构化推理轨迹。
Comments 22 pages, 9 figures
Qomhra: 一种双语爱尔兰语和英语大语言模型
机构 * Trinity College Dublin(三一学院) ; University College Cork(科克大学) ; Queen’s University Belfast(贝尔法斯特女王大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
AI总结 Qomhra是一种双语爱尔兰语和英语大语言模型,通过低资源约束下的方法生成人类偏好数据,显著提升了爱尔兰语和英语的性能表现。
TeleTables: 电信表格解释中的大语言模型基准
机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)
专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);pretraining(abstract)
AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。
BanglaLorica: 大型语言模型在孟加拉语文本生成中的鲁棒水印算法设计与评估
机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出分层水印策略,提升孟加拉语LLM在RTT攻击下的检测精度,实现3-4倍的相对提升。
Comments Under review, 12 pages, 7 figures, 5 tables
DVD:一种检测大规模语言模型评估中变体污染的稳健方法
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。
OpenEthics: 对开源生成大语言模型的全面伦理评估
机构 * Middle East Technical University(中东技术大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。
LLM4Perf: 大语言模型在多目标性能建模中的有效性
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 LLM4Perf通过大语言模型实现多目标性能建模,展现了其在配置空间修剪和反馈优化方面的有效性,提升了性能建模的准确性。
Comments ICSE 2026
AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准
机构 * College of Computer Science and Technology(计算机科学与技术学院) ; National University of Defense and Technology(国防科技大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。
Comments 13 pages, 7 figures, Accepted by ASE 2025
LPFQA: 一个基于长尾专业论坛的LLM评估基准
机构 * ByteDance Seed Peking University(字节跳动种子北京大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。
知识到数据:基于大语言模型的结构化网络流量合成用于无测试床IDS评估
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出利用大语言模型生成结构化网络流量数据集,以实现无测试床的IDS评估,通过显式约束提升数据真实性,使分类器在真实样本上的F1分数达到0.956。
探索神经与大语言模型在语言处理中的相似性
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本研究通过比较LLMs与人类大脑在语言处理中的轨迹相似性,揭示了语义整合机制和实时处理动态的差异。
大语言模型擦除方法的比较分析:跨架构评估
机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。
Comments 25 pages, 6 figures, 8 tables
AssertFlip: 通过翻转LLM生成的通过测试来复现错误
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)
AI总结 AssertFlip通过翻转LLM生成的通过测试来复现错误,有效提升错误复现效率。
重排序器作为相关性判断者
机构 * The University of Edinburgh(爱丁堡大学) ; University of Oklahoma(俄克拉荷马大学) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出将重排序器作为相关性判断者的方法,通过两种适应策略在重排序任务中实现优于现有方法的性能。
评估指纹:大语言模型评估器行为的稳定性和系统性差异
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 大语言模型评估器行为存在稳定且系统性的差异,其分歧模式可作为指纹,揭示不同模型对质量的隐含理论。
Comments 23 pages, 6 figures, code and artifacts at : https://github.com/wajid-nasser/evaluative-fingerprints