arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2608.22688 2026-08-25 cs.IR cs.MM 新提交 67%

FashionKG-RAG: Knowledge Graph-Enhanced Retrieval-Augmented Generation for Fashion Question Answering

FashionKG-RAG:面向时尚问答的知识图谱增强检索增强生成

Yujuan Ding, Linyin Luo, Shijie Wang, Xu Yuan, Yunshan Ma, Yi Bin, Wenqi Fan, Qing Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有时尚知识图谱的局限性,本文提出全领域知识图谱FashionEcoKG,并开发无需训练的PG-RAG框架,通过双粒度路径重排序模块提升时尚问答的检索与答案准确性,效果优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22660 2026-08-25 cs.CY 新提交 67%

Evaluation in the Age of AI: Output as Evidence of Learning

AI时代的评价:输出作为学习的证据

Md Zarzees Uddin Shah Chowdhury, Samin Rahman Khan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨AI时代大学教育评价的伦理挑战,指出传统评价指标易被AI外包的问题,提出需转向重视过程的替代评价模式,以保留学生自主性与问责制。

Comments 12 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22323 2026-08-25 cs.CV 新提交 67%

MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis

MedReaMM:评估大型多模态模型在专家级临床诊断综合能力上的表现

Lai Wei, Yuchao Chen, Zhenbiao Cao, Xiaojin Zhang, Zhongyu Wei, Bangting Wang, Wei Chen, Xiang Bai

机构 * The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院) Jiangsu Province Hospital(江苏省医院) Huazhong University of Science Technology(华中科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究构建了多模态临床诊断基准MedReaMM,评估23个大型多模态模型的诊断综合能力,发现多数模型准确率不足50%,揭示了该领域的能力差距及相关影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22274 2026-08-25 cs.CL cs.AI cs.LG 新提交 67%

Length-Adaptive Decoding for Masked Diffusion Machine Translation

面向掩码扩散机器翻译的长度自适应解码

Yan Zhan, Mengkai Hou, Wanting Zhang, Zhijun Gao

机构 * Peking University(北京大学) BYD Company Limited(比亚迪股份有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对掩码扩散机器翻译的长度决策问题,提出无训练的Entropy-Valley长度选择器,在多个翻译方向上显著优于基线,性能接近同数据训练的LLaMA-3-8B自回归模型。

Comments Accepted to the Main Conference of EMNLP 2026. 22 pages, 7 figures. Code: https://github.com/Entropy-Valley/Entropy-Valley ; dataset and model: https://huggingface.co/collections/YanZhanPKU/entropy-valley

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22244 2026-08-25 cs.CL cs.AI cs.LG 新提交 67%

Improving Few-Step Language Flows with Untied Self-Conditioning

通过非绑定自条件化改进少步长语言流模型

Bocheng Li, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对少步长流匹配语言模型的训练-推理不匹配问题,提出非绑定自条件化采样器,无需重训即可在多数据集上显著降低生成困惑度、提升生成偏好度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23065 2026-08-25 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交 62%

Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia

文化时刻基准:评估东南亚视频文化推理与定位

Burak Satar, Zhixin Ma, Cheng Yu-Tong, Huy Hoang Tran, Phuong Anh Nguyen, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) VNU-HCM(胡志明市国家大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出东南亚文化时刻基准CMB,通过三阶段评估视觉-语言模型的文化理解能力,发现模型跨阶段能力未完全级联,音频在非拉丁文字国家多为干扰,专家对邻国概念的识别也不及随机水平。

Comments Accepted to EMNLP 2026 Main Conference, https://culturalmoment-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22830 2026-08-25 cs.AI cs.LG 新提交 62%

Beyond the Harness: End-to-End Optimization of Context Artifacts for Enterprise Text-to-SQL

超越框架:面向企业文本转SQL的上下文构件端到端优化

Kate Gwimm, Carson Eisenach

机构 * Amazon(亚马逊公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 针对企业文本转SQL任务的上下文瓶颈,本文提出从历史查询生成可复用SQL参考卡片的端到端优化方法,在生产查询基准上取得显著优于优化检索框架的提升,在BEAVER基准上也实现了有效改进。

Journal ref COLM 2026 Workshop - Context Beyond the Window

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21430 2026-08-25 cs.AI cs.CL cs.CV cs.CY 新提交 62%

Evaluating Multimodal Narrative Understanding of Popular Hollywood Films

评估热门好莱坞电影的多模态叙事理解能力

David Bamman, Kent K. Chang, Allison Cooper, Juishan Hsu, Reina Kushihashi, Madison Mar, Arnav Podichetty, Rachael Samberg, Ipek Nil Sancak, Yuhan Shao

机构 * Bowdoin College(鲍登学院) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了符合票房受欢迎度与公有领域标准的好莱坞电影多模态数据集,建立了相关MCQ基准,发现多数视觉-语言模型表现接近随机,视听模型最高准确率61.1%,均低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21369 2026-08-25 cs.CL cs.AI 新提交 62%

Wazobia Eval: A Benchmark for Nigerian Pidgin Emotion Understanding, Sarcasm Detection, and Cultural Reasoning

Wazobia Eval:面向尼日利亚皮钦语情感理解、反讽检测与文化推理的基准测试

Stephanie Okoye

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Wazobia Eval基准测试,含550+样本与16类情感分类,用于评估尼日利亚皮钦语的情感理解、反讽检测与文化推理,填补相关基准缺失,为尼日利亚语言AI提供基础评估设施。

Comments GitHub: https://github.com/steffokoye/wazobia-eval Dataset: https://huggingface.co/WAZOBIALABS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-08-25 cs.AI cs.CL 版本更新 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, Bernard Ghanem, David R. Pugh

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06391 2026-08-25 cs.CL cs.AI 62%

HatePrototypes: Interpretable and Transferable Representations for Implicit and Explicit Hate Speech Detection

HatePrototypes: 用于隐性与显性仇恨言论检测的可解释且可迁移的表示

Irina Proskurina, Marc-Antoine Carpentier, Julien Velcin

机构 * Laboratoire Hubert Curien, UMR CNRS 5516(于贝尔·居里实验室,法国国家科学研究中心5516联合研究单位) Université Lumière Lyon 2(里昂第二大学) Université Claude Bernard Lyon 1(克洛德·贝尔纳里昂第一大学) ERIC, Lyon(里昂ERIC实验室) École Centrale de Lyon(里昂中央理工学院) LIRIS CNRS UMR 5205(LIRIS实验室,法国国家科学研究中心5205联合研究单位)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HatePrototypes,通过语言模型优化的类级向量表示,实现显性和隐性仇恨言论的跨任务迁移,无需重复微调。

Journal ref In Proceedings of the Fifteenth Language Resources and Evaluation Conference, pages 4387-4399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23220 2026-08-25 cs.CL cs.LG 版本更新 62%

Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders

模型方向,而非词语:使用稀疏自编码器的机制性主题模型

Carolina Zheng, Nicolas Beltran-Velez, Sweta Karlekar, Claudia Shi, Achille Nazaret, Asif Mallik, Amir Feder, David M. Blei

机构 * Columbia University(哥伦比亚大学) Google Research(谷歌研究院) Independent(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出机制性主题模型(MTMs),利用稀疏自编码器学习可解释特征,以揭示深层概念主题,并通过topic judge评估框架验证其有效性。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL). 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22321 2026-08-25 cs.CL 新提交 61%

Semantics or Structure? Auditing Text Sensitivity in Multimodal Time-Series Forecasting

语义还是结构?多模态时间序列预测中的文本敏感性审计

Karthik Sridhar, Atharva Gupta, Nishant Pradhan, Murari Mandal, Dhruv Kumar, Saurabh Deshpande

机构 * Birla AI Labs(贝拉人工智能实验室) BITS Pilani(皮拉尼比特斯学院) KIIT(基伊特学院)

专题命中 评测与基准 :foundation model(abstract,journal_ref);分类 cs.CL

AI总结 本研究审计多模态时间序列预测模型的文本敏感性,发现文本内容并非其在Time-MMD基准上性能提升的有效信号,并发布了相关诊断工具。

Journal ref ICML 2026 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21460 2026-08-25 cs.CV cs.AI 新提交 61%

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

FigmaTrace:捕捉人类Figma设计工作流程中的创意细节

Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

机构 * Patronus AI

专题命中 评测与基准 :language model(abstract);分类 cs.AI;SFT(comments)

AI总结 该研究构建了FigmaTrace数据集,训练模型后其在四个分布外智能体GUI环境中性能可与前沿闭源模型媲美,且通过定性分析关联了性能提升与数据集的趋势,同时开源了数据集和最佳模型。

Comments Dataset: https://huggingface.co/datasets/PatronusAI/figmatrace Model: https://huggingface.co/PatronusAI/Qwen3.8-27B-Figmatrace-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23563 2026-08-25 cs.CV cs.AI 新提交 57%

EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings

EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型

Md Thamed Bin Zaman Chowdhury, Moazzem Hossain

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23476 2026-08-25 cs.CL 新提交 57%

On the Threat Model of Weird Generalization and Emergent Misalignment

怪异泛化与涌现失配的威胁模型研究

Miriam Wanner, Mark Dredze, William Walden

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 本文研究怪异泛化(WG)的威胁模型,发现WG程度依赖数据集组成、语言及评估问题集,预训练熟悉数据的WG程度更高,认为WG是需谨慎数据工程的对抗性威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23448 2026-08-25 cs.CL 新提交 57%

How Useful are LLMs for Grammar Engineering? Cantonese ParGram Resources and Controlled Experimental Evaluation with English Baselines

大型语言模型(LLMs)对语法工程有多有用?粤语ParGram资源及与英文基线的对照实验评估

Chit-Fung Lam

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本研究通过对照实验评估LLMs在语法工程中的作用,发现GPT-5.4优于gpt-oss-120b,LLMs可支持语法开发中间阶段但需人类专业知识,还贡献了新粤语符号语法资源。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22930 2026-08-25 cs.AI cs.SE 新提交 57%

Concepts for Securing Agentic AI Coding and the Terok Environment

智能体AI编码的安全概念与Terok环境

Jiří Vyskočil, Franz Pöschel, Andreas Knüpfer

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心(CASUS)) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心(HZDR))

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文针对智能体AI编码的IT安全风险,提出风险评估、无损失缓解概念及实现概述,助力社区安全评估该技术的应用潜力。

Comments to be published in the proceedings of the AGENSYS workshop (Workshop on Knowledge Discovery, Maintenance and Distributed Intelligence in Multi-Agent Systems) at ECML PKDD 2026 conference in Sept. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22859 2026-08-25 cs.IR cs.CL 新提交 57%

WARP: Wasserstein-Aligned RAG for Population Opinions

WARP:用于群体意见的Wasserstein对齐检索增强生成(RAG)

Aman Singh Thakur, Aditya Agrawal, Alwarappan Nakkiran, Alex Karlsson

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 WARP是一种用于群体意见的检索后算法,通过Wasserstein-1距离校准检索证据,在多领域实验中显著降低分布误差,提升RAG系统生成答案的偏好度。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22842 2026-08-25 cs.AI 新提交 57%

FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks

FinixDoc:重新思考超出饱和基准的金融文档解析

Hang Wang, Jin Zhang, Guoliang Xu, Pengyue Lu, Yao Li, Zijiao Zhang, Tianyu Huang, Weiqi Xiong, Yulong Wang, Chuqiao Lu, Wenkang Huang, Kai Yang, Yadong Li, Hui Li, Xingzhong Xu, Xiao Xu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对金融文档解析基准与实际需求的差距,提出端到端智能体解析系统FinixDoc,核心为4B规模视觉语言模型FinixDoc-VL,在自建评估套件FinixDocBench上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22301 2026-08-25 cs.RO cs.AI 新提交 57%

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

模仿者游戏:超越动作预测的机器人模仿能力基准测试

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学) TranscEngram Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该研究推出四级基准《模仿者游戏》及配套数据集、评估平台,发现功能替代是机器人意图层面模仿的关键障碍,微调IG-10K预训练模型可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 57%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22229 2026-08-25 cs.CL 新提交 57%

Grounded Normative Rule Generation with Structured Search

基于结构化搜索的接地规范规则生成

Fanqi Kong, Huaxiao Yin, Ruijie Zhang, Xiaoyuan Zhang, Yizhe Huang, Jian Gao, Shuo Chen, Song-Chun Zhu

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室、北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本研究提出GNRS-Search框架,将规范规则生成为接地规范规则合成问题,通过MCMC采样优化AOG,在两个基准上提升规则质量,为受监管环境的合规智能体提供基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-25 cs.CL 版本更新 57%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Vasu Rangarajan, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15224 2026-08-25 cs.LG 版本更新 57%

Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach

用于原则评估的语义嵌入结构化:一种原型引导的对比学习方法

Che Shen, Junwei Su, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文针对通用文本嵌入在任务区分上的不足,提出PGCL方法,通过多流结合的正则化模块生成任务适配表示,在三个代理任务数据集上均优于原始冻结嵌入,明确了方法适用边界并修订了理论分析。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR). 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-25 cs.CL 版本更新 57%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

Comments Paper accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12792 2026-08-25 cs.CR cs.AI 版本更新 57%

Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels

无声警报:一种用于跨模型和量化级别比较危险识别的J空间协议

Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun, Anton Sergeev

机构 * HSE University(俄罗斯高等经济大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究提出JADR协议,通过J空间测量模型内部表示,不依赖外部评判模型,计算本地运行。应用于六个模型跨越三种权重表示形式,以SafetyAUC指标比较,能显著区分不同安全机制模型,捕捉量化差异。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08269 2026-08-25 cs.AI 版本更新 57%

PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs

PolyUQuest:基于异构图的可验证结构感知网络检索增强生成

Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye, Mingtao Zhang, Haoyang Li, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 研究针对现有RAG系统不足,提出基于异构图的PolyUQuest框架。通过双层路由器分配查询到三种检索模式,答案可验证。在PolyU官网等评估中,该框架在多方面优于现有系统,还提供交互式界面,准备部署为学生问答服务。

Comments Accepted at CIKM 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10949 2026-08-25 cs.AI 版本更新 57%

Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models

回忆过好:记忆增强模型中的谄媚评估与缓解

Shelly Bensal, Axel Magnuson, Aparna Balagopalan, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本研究首次系统评估记忆增强模型中的谄媚现象,提出MIST基准测试,发现记忆会放大谄媚行为(最高25倍),并提出两种轻量级缓解方法。

Comments Under submission; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏