arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2606.12709 2026-06-12 cs.MA cs.CR cs.LG 新提交 70%

Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows

更聪明的破坏者,更好的修复者:线性多智能体工作流中的规模与安全性

Timothy McAllister, Sina Abdidizaji, Ivan Garibay, Ozlem Ozmen Garibay

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究模型规模对线性多智能体工作流安全性的影响,发现大模型更易执行恶意指令,但轻量级修复阶段可恢复性能,表明线性结构在适当校正下具有鲁棒性。

Comments 16 pages (4 are main text), 2 figures, 6 tables. Accepted to the AIWILD Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12040 2026-06-12 cs.AI cs.GR 新提交 70%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07218 2026-06-12 cs.IR cs.CL 新提交 70%

HKVM-RAG: Key-Value-Separated Hypergraph Evidence Organization for Multi-Hop RAG

HKVM-RAG:用于多跳RAG的键值分离超图证据组织

Mingyu Zhang, Ying Ma

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出HKVM-RAG,一种键值分离的证据组织层,通过超图键值检索改进多跳RAG的证据链暴露,在三个基准上提升F1分数。

Comments Submitted to ICDE 2027. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12300 2026-06-11 cs.CV cs.AI 新提交 70%

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

自然语言在小时级视频中的时间定位是一个搜索问题:基准与经验分解

Sukmin Seo, Geewook Kim

机构 * NAVER Cloud AI KAIST AI(韩国科学技术院人工智能系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对小时级视频的自然语言时间定位,提出搜索是主要瓶颈而非识别,发布首个开放小时级定位基准ExtremeWhenBench,并通过检索-定位混合方法显著提升性能。

Comments 10 pages, 6 figures, Code and benchmark: https://github.com/naver-ai/ExtremeWhenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11830 2026-06-11 cs.AI 新提交 70%

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

面向医学研究分析的技能增强型AI代理:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估

Qianyu Yao, Fei Sun, Bocheng Huang, Wei Chen, Jiarui Jiang, Shu Quan, Yifei Chen, Wenjie Xu, Bo li, Liping Su, Ruoqiong Wu, Huhai Hong, Huimei Wang

机构 * AIPOCH PTE. LTD.

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过非小细胞肺癌免疫治疗生物标志物任务,评估技能增强型AI代理相比原生AI在转录组研究分析输出质量上的提升,发现质量信号方向性但未达统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11361 2026-06-11 cs.IR cs.CL 新提交 70%

A PubMed-Scale Dataset of Structured Biomedical Abstracts

一个PubMed规模的生物医学结构化摘要数据集

Chia-Hsuan Chang, Haerin Song, Brian Ondov, Hua Xu

机构 * Department of Biomedical Informatics & Data Science, School of Medicine, Yale University(耶鲁大学生物医学信息学与数据科学系,医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对PubMed中大量非结构化摘要阻碍下游文本处理的问题,构建了包含2320万条记录的结构化摘要语料库,其中590万条来自官方XML,1720万条通过大语言模型自动标注,统一为五段格式。

Comments Data and code for this work are available at https://doi.org/10.5281/zenodo.20336717 and https://github.com/BIDS-Xu-Lab/StructuredPubMed, respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10657 2026-06-10 cs.CL 新提交 70%

Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

我们是在评估知识还是措辞?使用ParaEval减轻MCQA敏感性

João Maria Janeiro, Mathurin Videau, Andrea Caciolai, Benjamin Piwowarski, Patrick Gallinari, Loic Barrault

机构 * FAIR at Meta(Meta FAIR) Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学,法国国家科学研究中心,智能系统与机器人研究所,法国巴黎) Criteo AI Lab, Paris, France(Criteo AI实验室,法国巴黎)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多选题基准测试对答案措辞敏感的问题,提出ParaEval框架,通过对每个选项使用多种释义并选择最有利的评分,将虚假性能差距从2分以上降至1分以下,从而评估模型真实能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10571 2026-06-10 cs.CV cs.AI cs.CR 新提交 70%

Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction

通过代理特定偏差校正提高视觉-语言预训练模型上的对抗迁移性

Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DeBias-Attack方法,通过梯度校正消除代理特定偏差,提高对抗样本在VLP模型间的迁移性,实验验证其在多种模型和任务上的有效性。

Comments 17 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10525 2026-06-10 cs.CR cs.AI 新提交 70%

Assessing Automated Prompt Injection Attacks in Agentic Environments

评估智能体环境中的自动化提示注入攻击

David Hofer, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10489 2026-06-10 cs.AI 新提交 70%

A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner

PlanGPT的补充研究:使用定义性能指标评估并与规划器比较

Youssef Abdelkader, Humbert Fiorino, Damien Pellier

机构 * Univ. Grenoble Alpes - LIG(格勒诺布尔阿尔卑斯大学 - 信息学实验室(LIG))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文对大型语言模型PlanGPT进行补充实验,使用规划成本和生成时间两个指标评估其性能,并与传统规划器比较,发现PlanGPT并不优于贪心搜索策略。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10394 2026-06-10 cs.AI 新提交 70%

STAGE-Claw: Automated State-based Agent Benchmarking for Realistic Scenarios

STAGE-Claw:面向真实场景的基于状态的智能体自动化基准测试

Sirui Liang, Bohan Yu, Peiyu Wang, Shiguang Guo, Wenxing Hu, Pengfei Cao, Jian Zhao, Cao Liu, Ke Zeng, Xunliang Cai, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出STAGE-Claw框架,自动构建基于状态的个人计算环境中的真实场景任务,通过最终系统状态而非文本响应评估智能体性能,创建40个挑战性任务并分析11个前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 70%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09411 2026-06-09 cs.CR cs.IT cs.LG math.IT 新提交 70%

Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs

现在你(仍然)能看到我:检测大语言模型中的隐蔽隐写载荷

Charles Westphal, Timothy Douglas, Keivan Navaie, Tiago Pimentel, Fernando E. Rosas

机构 * UCL Centre for AI(UCL人工智能中心) University College London(伦敦大学学院) ML Alignment Theory Scholars(机器学习对齐理论学者) Department of Computer Science(计算机科学系) School of Computing and Communications(计算与通讯学院) ETH Zürich(苏黎世联邦理工学院) University of Sussex(Sussex大学) Imperial College London & University of Oxford(伦敦帝国学院与牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型隐写外泄风险,提出一种基于非线性MLP探针的对抗性微调方法可系统规避现有线性探针检测,但通过信息论指导的数据级干预可恢复检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08800 2026-06-09 cs.AI 新提交 70%

Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution

通过自进化桥接专家知识与自动化特征工程

Varun Khurana, Vijval Ekbote, Vashu Chauhan, Yaman Kumar Singla, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) IIIT-Delhi(德里印度理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08790 2026-06-09 cs.AI cs.CR cs.MA 新提交 70%

RAILS: Verification-Native Clearing For Agentic Commerce

RAILS: 面向代理商务的验证原生清算

Adrian de Valois-Franklin, Alex Bogdan

机构 * Evolutionairy AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对自主代理在商务活动中缺乏中立清算机制的问题,提出RAILS协议,通过可靠性评分、记录和清算函数实现验证原生清算,确保财务结算基于充分证据。

Comments 49 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07805 2026-06-09 cs.AI cs.MA 新提交 70%

Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems

超越古德哈特定律:多智能体系统中合规性评估的动态基准

Yiyang Zhao, Zhuo Zhang, Qingxuan Le, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Monash University(莫纳什大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多智能体系统在压力下可能违反安全规则的问题,提出MAC-Bench动态对抗基准,通过SERV流水线生成无污染场景,并引入CSR和MG指标评估前沿模型的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07783 2026-06-09 cs.CL 新提交 70%

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

评估RAG在干净、误导和混合检索下的可靠性

Sevgi Yigit-Sert

机构 * Ankara University(安卡拉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 70%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07219 2026-06-08 cs.CL cs.SI 新提交 70%

Adversarial Creation and Detection of AI-Generated Social Bot Content

AI生成的社交机器人内容的对抗性创建与检测

Mykola Trokhymovych, Ricardo Baeza-Yates, Alessandro Flammini, Diego Saez-Trumper, Filippo Menczer

机构 * Universitat Pompeu Fabra(庞培法拉大学) Observatory on Social Media, Indiana University(社交媒体观测站,印第安纳大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出对抗性方法模拟恶意用户冒充真人,构建多语言跨平台配对数据集,训练检测模型显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07032 2026-06-08 cs.CV cs.AI 新提交 70%

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06754 2026-06-08 cs.MA cs.CL 新提交 70%

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分

Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08634 2026-08-11 cs.AI cs.CL cs.IR q-fin.GN 新提交 68%

Can Open-Weight Models Compete on Financial Text Comprehension?

开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?

Jan Spörer

机构 * University of St. Gallen(圣加仑大学)

专题命中 评测与基准 :language model(abstract,comments);分类 cs.CL、cs.AI;large language model(comments)

AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。

Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26103 2026-08-27 cs.RO cs.CV 新提交 67%

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。

Comments https://robbyant-research.github.io/Zero-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25815 2026-08-27 cs.CY q-bio.NC 新提交 67%

GenAIT: Development and Validation of an Objective Generative AI Literacy Test for High School Students

GenAIT:面向高中生的客观生成式AI素养测试的开发与验证

Brett Puppart, Kristjan-Julius Laak, Jaan Aru

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究开发并验证了面向高中生的GenAIT测试,其18道题覆盖GenAI多领域知识,经大样本验证适用于群体研究,且发现AI使用频率与概念理解负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23821 2026-08-26 q-bio.QM 新提交 67%

Finch: Toxicity Dose Response Curve Prediction of Chemical Compounds and Mixtures

Finch:化学化合物及混合物的毒性剂量反应曲线预测

Abdullah Shouaib, John Zapanta, Sean P. Davern, Samuel Dixon, Zachary R. Stromberg, Becky Hess, Sydney Schwartz, C Mark Maupin

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Finch整合多任务定量构效关系模型,解决传统混合物模型的局限,实现化学化合物及混合物的毒性剂量反应曲线预测,助力监管安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23501 2026-08-25 cs.SE 新提交 67%

An Interactive Agent for Requirement-Driven Candidate Sourcing

面向需求驱动型候选人挖掘的交互式智能体

Yuanpeng He, Fangjing Li, Xiangyu Ru, Kexin Sun, Kun Yang, Lijian Li, Chi-Man Pun, Qingsong Wen, Wenpin Jiao, Mingkai Guo, Yirong Feng, Daiheng Gao, Zhi Jin

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对自然语言描述的人才挖掘任务,提出首个交互式需求驱动型候选人挖掘智能体,在21个系统和691项需求上,其广度和召回率均优于现有基线模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23185 2026-08-25 cs.CR 新提交 67%

Towards Automated Cyber Threat Intelligence Elicitation in Underground Forums

面向地下论坛中自动化网络威胁情报的获取

Lorenzo Bossi, Federico Saccani, Francesco Panebianco, Antonio Maci, Stefano Zanero, Stefano Longari, Michele Carminati

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出首个基于多智能体大语言模型的主动CTI获取系统DarkBot,其在受控与真实世界实验中均优于基线,可从地下论坛高效获取CTI且安全合规。

Comments 23 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22758 2026-08-25 cs.CL cs.AI cs.LG 新提交 67%

XTC: Head-Aware Sampling by Excluding Top Choices

XTC:通过排除顶部选择的头感知采样

Philipp Emanuel Weidmann, Allen Roush, Judah Goldfeder, Sanjay Basu, Ravid Shwartz-Ziv

机构 * Thoughtworks(Thoughtworks公司) Columbia University(哥伦比亚大学) Oracle(甲骨文公司) New York University(纽约大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 XTC是一种轻量头感知解码算子,通过排除部分高概率词元改善自回归语言模型的多样性-重复帕累托前沿,在多项实验中提升创意生成效果且准确率损失极小,已被多个工具采用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22751 2026-08-25 cs.IR 新提交 67%

Risk-Aware Reranking for Agentic Tool Retrieval

面向智能体工具检索的风险感知重排序

Qinfei Li, Xiaoxuan Dong, Jin Zhang, Dexu Yu, Wenhao Deng, Junchen Fu, Youhua Li, Hanwen Du, Chunxiao Li

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文针对智能体工具检索的风险问题,提出轻量级风险感知重排序框架,通过权衡安全与效用改善相关性-安全 tradeoff,为安全关键部署提供保守操作点。

Comments Accepted by CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22688 2026-08-25 cs.IR cs.MM 新提交 67%

FashionKG-RAG: Knowledge Graph-Enhanced Retrieval-Augmented Generation for Fashion Question Answering

FashionKG-RAG:面向时尚问答的知识图谱增强检索增强生成

Yujuan Ding, Linyin Luo, Shijie Wang, Xu Yuan, Yunshan Ma, Yi Bin, Wenqi Fan, Qing Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有时尚知识图谱的局限性,本文提出全领域知识图谱FashionEcoKG,并开发无需训练的PG-RAG框架,通过双粒度路径重排序模块提升时尚问答的检索与答案准确性,效果优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏