arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 346 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 51 篇

2608.28144 2026-08-31 cs.AI 新提交 70%

The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues

权力的形态:面向对话中社会权力推理的多语言框架

Farah Atif, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对现有社会权力计算研究的语言文化局限,提出基于社会科学理论的多语言对话社会权力推理框架,构建含15836个实例的双语语料库,评估6类大模型并发现其与人类推理的差距,为跨文化社会推理提供评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27869 2026-08-31 cs.AI 新提交 70%

See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs

观测、假设、验证:用于发现控制偏微分方程的多模态智能体框架

Sarang Manoj Pekhale, Amartya Roy, Rajat Sarkar, Souvik Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院) Robert Bosch GmbH(罗伯特·博世有限公司) TCS Research(塔塔咨询服务公司研究院) Yardi School of Artificial Intelligence (ScAI)(亚迪人工智能学院) Department of Applied Mechanics(应用力学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多模态智能体框架MAGE,通过四个专业化智能体协作迭代发现控制PDE,在经典PDE套件等测试中实现优异恢复与误差表现,支持无库控制定律发现的结构化智能体推理研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27756 2026-08-31 cs.CL 新提交 70%

Load-Bearing Context: The Question Damage Score for Evaluating Context Reliance in Linguistic Reasoning

承载上下文:用于评估语言推理中上下文依赖程度的问题损伤分数

Neh Majmudar, Elena Filatova

机构 * CUNY(纽约城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出基于53道英国语言学奥林匹克谜题的诊断框架,用问题损伤分数评估大型语言模型的上下文依赖,发现前沿模型在承载上下文移除后仍常产生正确答案,推动相关推理与可解释性研究。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26747 2026-08-31 cs.AI 版本更新 70%

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Annie Zheng, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26263 2026-08-31 cs.AI cs.MA 版本更新 70%

SKILL.state: Scalable Long-Horizon Agent Skills

SKILL.state:可扩展的长程智能体技能

Sanket Badhe, Priyanka Tiwari, Jonghyun Chung

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。

Comments accepted at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18682 2026-08-31 cs.AI 版本更新 70%

RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

RTPO:用于稳定智能体强化学习训练的反向回合策略优化

Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu

机构 * Adelaide University(阿德莱德大学) The University of Sydney(悉尼大学) Curtin University(科廷大学) School of CSIT(计算机科学与信息技术学院) ACFR(澳大利亚空间研究中心) School of EECMS(电子工程、计算机与数学科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-08-31 cs.AI 版本更新 70%

SEGRA: A Structured Experience Guided Reasoning Agent for Property Graph Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

Comments Accepted at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 70%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28435 2026-08-31 cs.RO 新提交 67%

Linear Temporal Logic Translation via Human-Inspired Self-Constrained Reasoning for Robot Task Specification

面向机器人任务规范的、基于类人自约束推理的线性时态逻辑翻译

Haofei Hou, Fanxu Meng, Shunyi Zhao, Kairui Yang, Mengchen Cai, Lecheng Ruan, Qining Wang

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) School of Integrated Circuits, Peking University(北京大学集成电路学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 该研究提出自约束推理(SCR)框架,将结构知识内化到模型决策中,以在不破坏推理的前提下,提升将人类指令翻译为线性时态逻辑(LTL)时的领域约束满足度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28212 2026-08-31 cs.MM cs.SD 新提交 67%

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

MuSP-Bench:面向乐谱与演奏的高级多模态音乐理解基准测试

Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究人员推出MuSP-Bench基准测试,含490个乐谱与演奏理解问题,评估发现前沿多模态大语言模型理解乐谱困难,推理演奏音频时挑战更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 67%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 67%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-08-31 cs.CR 版本更新 67%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 57%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17981 2026-08-31 cs.LG 版本更新 57%

Recirculation

再循环

Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind) University of Texas, Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出推理时架构增强技术“再循环”及其自适应变体,无需额外训练,可显著降低Gemma3系列模型的困惑度、提升推理任务准确率,为架构演进提供新方向。

Comments v2: added citations to related work, included more methodological details concerning perplexity evaluation which help explain the large reductions in perplexity observed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-08-31 cs.CV cs.AI 版本更新 57%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

Comments Accepted by 2026 IEEE/ACM Symposium on Edge Computing (SEC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29150 2026-08-31 cs.AI 版本更新 57%

Flow Reasoning Models: Turning Discrete Flows Into Efficient Recurrent Reasoners

流推理模型:通过迭代自我精炼扩展推理能力

Alec Helbling, Andrey Bryutkin, Mauro Martino, Duen Horng Chau, Nima Dehmamy, Hendrik Strobelt

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI

AI总结 提出流推理模型(FRMs),利用去噪动态的稳定性作为验证器,通过测试时缩放和训练改进,高效解决数独和斑马谜题等结构化推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27793 2026-08-31 cs.RO 新提交 50%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 50%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 推理与问题求解 :language model(abstract)

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 75 篇

2608.27465 2026-08-31 cs.CL cs.AI cs.CY cs.HC 新提交 92%

The Effect of Emotional Context on Large Language Models' Endorsement of Premature Decisions: Comparing Emotional Vulnerability Across Six Commercial Models

情绪语境对大语言模型支持仓促决策的影响:六种商业模型的情绪脆弱性比较

Cheolho Shin, Yoojin Han, Donghun Shin, Kunho Lee

机构 * Yonsei University(延世大学) Fudan University(复旦大学) St. Johnsbury Academy Jeju(济州圣约翰斯伯里学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究探究情绪语境对LLM支持仓促决策的影响,测试六种商业模型后发现情绪会显著提升模型的支持度,且脆弱性因单个模型而异,仅Claude Opus无显著情绪效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27746 2026-08-31 cs.IR 新提交 92%

NormasTCU --- A Brazilian Portuguese IR Dataset and an Evaluation of LLM-as-a-Judge for Relevance Assessment

NormasTCU——巴西葡萄牙语信息检索数据集及LLM作为相关性评估评判的评估

Leandro Carísio Fernandes, Marcus Vinícius Borela de Castro, Leandro dos Santos Ribeiro, Leonardo Augusto da Silva Pacheco, Edans Flávius de Oliveira Sandes

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对巴西葡萄牙语IR领域缺乏公开数据集的问题,该研究构建了NormasTCU数据集,评估了LLM作为相关性评估评判的效果,发现其在排名感知指标上与人类评判的系统排名相关性较强,可用于该场景的可扩展相关性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-31 cs.CL cs.AI 版本更新 92%

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 31 pages, 9 figures (3 main body, 6 appendix), 18 tables (1 main body, 17 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-31 cs.HC 版本更新 92%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large Language Models

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28490 2026-08-31 cs.CR cs.AI 新提交 92%

LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment

基于大语言模型(LLM)的软件与系统安全智能体:方法、应用与评估

Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过系统综述2023-2026年的同行评审文献,梳理基于LLM的软件与系统安全智能体的技术方法、应用及评估,指出当前智能体权限未受限、行为不可审计的局限,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-31 cs.CL 版本更新 92%

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27703 2026-08-31 cs.SE 新提交 91%

Operationalizing Regulations into Code: A Model to Enhance Governance and Compliance in LLM Selection for Software Engineering

将法规转化为代码:一种用于增强软件工程中大型语言模型(LLM)选择的治理与合规性的模型

Jonysberg Quintino, Hermano Moura, Filipe Calegário

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于设计科学研究的三层模型,将法规转化为可操作的LLM选择标准,试点评估显示该模型可识别合规风险,为软件工程LLM治理提供可行方案。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12066 2026-08-31 cs.LG cs.AI cs.CL 版本更新 90%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 17 pages, 7 figures, 9 tables. Code and data available at this https URL (https://github.com/erikl2/safety-refusal-stability). v3: corrects dataset attribution (AdvBench+HarmBench, not BeaverTails), fixes label-derived statistics and CIs, revises the judge-noise analysis to a sensitivity framing; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27470 2026-08-31 cs.CL cs.AI cs.DB 新提交 90%

Select, Don't Train: The Benefits of Modular Entity Disambiguation with LLM-Based Selection

选择,而非训练:基于大语言模型(LLM)选择的模块化实体消歧的优势

Fina Polat, Daniel Daza, Pengyu Zhang, Klim Zaporojets, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Aarhus University(奥胡斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究提出将实体消歧的检索与选择解耦,基于LLM选择器对比不同检索策略,发现无需训练的BM25搭配LLM选择器在ZELDA基准上达到先进性能,还支持检测到检索失败时弃权,提升了实体消歧效果。

Comments Accepted at the 25th International Semantic Web Conference (ISWC 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27990 2026-08-31 cs.CR cs.AI 新提交 90%

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN:大语言模型智能体能否自主合成针对新型注入攻击的防御措施?

Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体注入攻击防御的三难困境,提出智能体无关防御中间件CAITLYN,其含即时防御与自主合成新防御的双系统,在标准基准与新基准Emerging上均表现优异,可降低攻击成功率。

Comments Source code: this https URL (https://github.com/liangzid/caitlyn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27817 2026-08-31 cs.SD cs.CL eess.AS 新提交 90%

Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation

针对已知任务音频-LLM评估的生成式音频调用审计

Mengzhe Geng

机构 * National Research Council Canada(加拿大国家研究委员会)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL

AI总结 本研究将生成式音频调用评估设为受控决策问题,通过VocalSound数据集实验发现,带生成式调用的选择器准确率达0.925,优于无调用对照,明确了生成式调用在音频-LLM已知任务评估中的边际价值。

详情

展开后加载摘要…

URL PDF HTML 收藏