arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 145 篇

2501.16029 2026-01-21 cs.CR cs.AI 81%

FDLLM: A Dedicated Detector for Black-Box LLMs Fingerprinting

FDLLM:一种专为黑盒LLM指纹识别设计的检测器

Zhiyuan Fu, Junfan Chen, Lan Zhang, Ting Yang, Jun Niu, Hongyu Sun, Ruidong Li, Peng Liu, Jice Wang, Fannv He, Qiuling Yue, Yuqing Zhang

机构 * College of Cyberspace Security, Hainan University(海南大学网络安全学院) National Computer Network Intrusion Protection Center, University of Chinese Academy of Sciences(中国科学院大学国家计算机网络入侵防护中心) Graduate School of Natural Science and Technology, Kanazawa University(北九州市立大学自然科学技术研究生院) School of Cyber Engineering, Xidian University(西安电子科技大学 cyber 工程学院) School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络系统学院) College of IST, Pennsylvania State University(宾夕法尼亚州立大学信息科技学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 FDLLM通过LoRA技术实现高效LLM指纹识别,具备高准确率和鲁棒性,有效提升模型识别与安全防护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12091 2026-01-21 cs.LG 81%

Mitigating Cultural Bias in LLMs via Multi-Agent Cultural Debate

通过多智能体文化辩论缓解LLM中的文化偏见

Qian Tan, Lei Jiang, Yuting Zeng, Shuoyang Ding, Xiaohua Xu

机构 * University of Science and Technology of China(中国科学技术大学) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过多智能体文化辩论框架,有效缓解LLM中的文化偏见,提升跨文化公平性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13885 2026-01-21 cs.CL cs.AI 81%

Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores

在更少项目中获得可靠的排名:基于连续评分的自适应LLM评估

Esma Balkır, Alice Pernthaller, Marco Basaldella, José Hernández-Orallo, Nigel Collier

机构 * Trismik Leverhulme Centre for the Future of Intelligence, University of Cambridge(Leverhulme智能未来研究中心,剑桥大学) Universitat Politècnica de València(瓦伦西亚理工大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于连续评分的自适应LLM评估方法,通过异方差正态分布替代伯努利分布,实现更高效的模型排名,使用2%的项目提升了排名相关性并达到95%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01576 2026-01-21 cs.IR cs.AI cs.CL 81%

OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment

OpenNovelty: 一种基于大语言模型的代理系统,用于可验证的学术新颖性评估

Ming Zhang, Kexin Tan, Yueyuan Huang, Yujiong Shen, Chunchun Ma, Li Ju, Xinran Zhang, Yuhui Wang, Wenqing Jing, Jingyi Deng, Huayu Sha, Binze Hu, Jingqi Tong, Changhao Jiang, Yage Geng, Yuankai Ying, Yue Zhang, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Claremont McKenna College(克莱蒙特麦肯纳学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 OpenNovelty通过基于大语言模型的代理系统,提供可验证的学术新颖性评估,提升同行评审的公平性和证据支持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19825 2026-01-21 cs.LG cs.AI cs.DB 81%

Position: Foundation Models for Tabular Data within Systemic Contexts Need Grounding

位置:在系统性情境中为表格数据构建的基础模型需要接地

Tassilo Klein, Johannes Hoffart

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出语义链接表和SLT基础模型,通过双阶段训练实现表格数据在操作上下文中的接地,强调操作知识对自主代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10795 2026-01-21 cs.CL 79%

Beyond "Not Novel Enough": Enriching Scholarly Critique with LLM-Assisted Feedback

超越‘不够新颖’:利用LLM辅助反馈丰富学术批评

Osama Mohammed Afzal, Preslav Nakov, Tom Hope, Iryna Gurevych

机构 * UKP Lab, TU Darmstadt and Hessian Center for AI (hessian.AI)(图林人工智能实验室、德累斯顿理工大学和黑森人工智能中心) MBZUAI(马克斯·普朗克人工智能研究所) The Allen Institute for AI (AI2)(人工智能研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出一种结构化LLM辅助方法,通过三个阶段评估论文新颖性,实现86.5%的人类推理一致性,显著优于现有基线方法,提升同行评审的严谨性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10597 2026-01-21 cs.CV cs.AI 79%

Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models

Text2Seg: 通过文本引导的视觉基础模型实现遥感图像语义分割

Jielu Zhang, Zhongliang Zhou, Gengchen Mai, Mengxuan Hu, Zihan Guan, Sheng Li, Lan Mu

机构 * University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 Text2Seg通过文本引导的视觉基础模型实现遥感图像语义分割,显著提升零样本预测性能。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12973 2026-01-21 cs.CL 79%

Pardon? Evaluating Conversational Repair in Large Audio-Language Models

Pardon? 评估大型音频-语言模型中的会话修复

Shuanghong Huang, Jinlei Xu, Youchao Zhou, Yanghao Zhou, Xuan Zhao, Chong Feng, Wenxuan Zhang

机构 * Beijing Institute of Technology(北京理工大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出EAR评分,用于评估大型音频-语言模型在语音问答任务中对可回答和不可回答输入的处理能力及修复行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11821 2026-01-21 cs.LG 79%

Shapelets-Enriched Selective Forecasting using Time Series Foundation Models

基于时间序列基础模型的形状let增强选择性预测

Shivani Tomar, Seshu Tirupathi, Elizabeth Daly, Ivana Dusparic

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出基于形状let的选性预测框架,利用时间序列基础模型减少预测误差,提升模型可靠性。

Comments Accepted by the AAAI-26 Workshop on Artificial Intelligence for Time Series Analysis (AI4TS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24294 2026-01-21 cs.CL cs.HC 79%

LOGOS: LLM-driven End-to-End Grounded Theory Development and Schema Induction for Qualitative Research

LOGOS: 基于大语言模型的端到端 grounded theory 开发与模式诱导用于定性研究

Xinyu Pi, Qisen Yang, Chuong Nguyen

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 LOGOS 是一种基于大语言模型的端到端框架,通过自动化 grounded theory 工作流程,实现定性研究的结构化理论开发和模式诱导,显著提升了研究的可扩展性和理论精确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16073 2026-01-21 cs.LG cs.AI cs.MA 79%

Mathematical Framework for Custom Reward Functions in Job Application Evaluation using Reinforcement Learning

基于强化学习的作业申请评估中自定义奖励函数的数学框架

Shreyansh Jain, Madhav Singhvi, Shreya Rahul Jain, Pranav S, Dishaa Lokesh, Naren Chittibabu, Akash Anandhan

机构 * Department of Computer Science and Engineering, SRM Institute of Science and Technology(计算机科学与工程系,SRM科学与技术学院) Department of Computer Science and Engineering, Sastra University(计算机科学与工程系,萨斯特拉大学) Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校) O6AI LABS(O6AI实验室)

专题命中 评测与基准 :language model(abstract);small language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于强化学习的作业申请评估系统,通过两阶段微调流程优化小语言模型,实现高准确率和可靠性的候选人筛选。

Comments 13 pages, 4 figures, 2 equations, 3 Tables

Journal ref ICCCA 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12754 2026-01-21 cs.HC cs.AI cs.CL cs.CY 79%

PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support

PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持

Jiwon Kim, Violeta J. Rodriguez, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23816 2026-01-21 cs.CL cs.LG 79%

A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs

在可转向性评估中的课程修正:揭示LLMs中的误校准与副作用

Trenton Chang, Tobias Schnabel, Adith Swaminathan, Jenna Wiens

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种多维目标空间框架,揭示LLMs在文本改写任务中存在意外副作用,表明现有对齐策略可能不足。

Comments 8 pages, 6 figures. 26 pages of references and supplementary material, 22 additional figures. Association for the Advancement of Artificial Intelligence Conference (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10054 2026-01-21 q-bio.OT 78%

SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model

SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能

Yaoqian Li, Xikai Yang, Dunyuan Xu, Yang Yu, Litao Zhao, Xiaowei Hu, Jinpeng Li, Pheng-Ann Heng

专题命中 评测与基准 :language model(title,abstract)

AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12820 2026-01-21 cs.CV 78%

A Generalist Foundation Model for Total-body PET/CT Enables Diagnostic Reporting and System-wide Metabolic Profiling

一种通用的基础模型用于全身PET/CT,实现诊断报告和系统层面的代谢分析

Wei Chen, Liang Wu, Shuyi Lu, Yuanyuan Sun, Wenkai Bi, Zilong Yuan, Yaoyao He, Feng Wang, Junchi Ma, Shuyong Liu, Zhaoping Cheng, Xiaoyan Hu, Jianfeng Qiu

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 SDF-HOLO是一种用于全身PET/CT的通用基础模型,通过多模态学习实现诊断报告和系统代谢分析,提升医疗影像处理的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12480 2026-01-21 cs.SD eess.AS 78%

A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation

一种统一的神经编码语言模型用于选择性可编辑的文本到语音生成

Hanchen Pei, Shujie Liu, Yanqing Liu, Jianwei Yu, Yuanhang Qian, Gongping Huang, Sheng Zhao, Yan Lu

机构 * School of Electronic Information, Wuhan University, China(武汉大学电子信息学院) Microsoft Corporation(微软公司)

专题命中 评测与基准 :language model(title,abstract)

AI总结 SpeechEdit是一种通过选择性控制机制实现灵活属性控制的神经编码语言模型,用于可编辑的文本到语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12382 2026-01-21 cs.CV 78%

A Hierarchical Benchmark of Foundation Models for Dermatology

基础模型在皮肤病学中的分层基准

Furkan Yuceyalcin, Abdurrahim Yilmaz, Burak Temelkuran

机构 * Yildiz Technical University(伊兹密尔技术大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出分层评估框架,揭示基础模型在皮肤病学中的粒度能力差异,强调专用模型在细粒度诊断中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-01-21 cs.AI 77%

LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13876 2026-01-21 cs.CL 77%

Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education

为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估

Unggi Lee, Jahyun Jeong, Sunyoung Shin, Haeun Park, Jeongsu Moon, Youngchang Song, Jaechang Shim, JaeHwan Lee, Yunju Noh, Seungwon Choi, Ahhyun Kim, TaeHyeon Kim, Kyungtae Joo, Taeyeong Kim, Gyeonggeon Lee

机构 * Chosun University(全州大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13690 2026-01-21 cs.CL 77%

Dr. Assistant: Enhancing Clinical Diagnostic Inquiry via Structured Diagnostic Reasoning Data and Reinforcement Learning

通过结构化诊断推理数据和强化学习增强临床诊断探究

Yue Guo, Fanfu Wang, Jianwei Lv, Xincheng Shi, Yuchen Li, Youya Wang, Yunsheng Zeng, Yujing Liu, Yunhao Qiao, Gen Li, Junfeng Wang, Bo Yuan

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 Dr. Assistant通过结构化诊断推理数据和强化学习提升临床诊断能力,优于开放源代码模型并接近闭源模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13669 2026-01-21 cs.CL 77%

CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks

CommunityBench: 跨多样化群体和任务的社区级对齐基准测试

Jiayu Lin, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 CommunityBench通过四个基于共同身份和共同纽带理论的任务,评估了社区级对齐方法,揭示了现有LLMs在建模社区特定偏好上的局限性,并探索了社区级对齐在促进个体建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15047 2026-01-21 cs.CL 77%

RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search

RainbowPlus:通过进化质量-多样性搜索增强对抗性提示生成

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RainbowPlus通过进化质量-多样性搜索提升对抗性提示生成,实现更高的攻击成功率和多样性,且运行效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13186 2026-01-21 cs.AI cs.MA 77%

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

通过语义缓存、嵌套学习和AI可持续性缓解提示注入

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13050 2026-01-21 cs.CL 77%

Profiling German Text Simplification with Interpretable Model-Fingerprints

通过可解释模型指纹 profiling 德语文本简化

Lars Klöser, Mika Beele, Bodo Kraft

机构 * Aachen University of Applied Sciences(亚琛应用科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出简化分析仪,通过可解释模型指纹分析德语文本简化,实现高效诊断和行为特征识别,提升文本简化系统的适应性。

Comments Presented at 2nd International Conference on Explainable AI for Neural and Symbolic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13007 2026-01-21 cs.SE cs.AI 77%

ArchAgent: Scalable Legacy Software Architecture Recovery with LLMs

ArchAgent: 基于LLM的可扩展遗留软件架构恢复

Rusheng Pan, Bingcheng Mao, Tianyi Ma, Zhenhua Ling

机构 * HiThink Research(慧思研究) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ArchAgent通过结合静态分析、自适应分段和LLM合成,实现大规模遗留软件架构的高效恢复与多视图业务对齐。

Comments to be published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12505 2026-01-21 cs.CL 77%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12392 2026-01-21 cs.AI 77%

PsychēChat: An Empathic Framework Focused on Emotion Shift Tracking and Safety Risk Analysis in Psychological Counseling

PsychēChat: 一种专注于心理辅导中情感转变跟踪和安全风险分析的共情框架

Zhentao Xia, Yongqi Fan, Yuxiang Chu, Yichao Yin, Liangliang Chen, Tong Ruan, Weiyan Zhang

机构 * East China University of Science and Technology(东华大学) Shanghai Changning Mental Health Center, Affiliated Mental Health Center of East China Normal University(上海昌宁心理健康中心,华东师范大学附属心理健康中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PsychēChat通过情感管理与风险控制模块,提升心理辅导中情感转变跟踪和安全风险分析的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12014 2026-01-21 cs.AI cs.SE 77%

Are LLMs Ready for TOON? Benchmarking Structural Correctness-Sustainability Trade-offs in Novel Structured Output Formats

LLMs是否准备好迎接TOON?在新型结构化输出格式中评估结构正确性与可持续性的权衡

Elio Masciari, Vincenzo Moscato, Enea Vincenzo Napolitano, Gian Marco Orlando, Marco Perillo, Diego Russo

机构 * University of Naples Federico II(那不勒斯费迪里奇二世大学) University of Bergamo(贝拉姆乔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种考虑环境效率的评估框架,评估新型结构化输出格式TOON在结构正确性与可持续性之间的权衡,发现TOON在紧凑性和排放方面表现优异,但需依赖模型容量以提升正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16466 2026-01-21 cs.AI 77%

ReviewSense: Transforming Customer Review Dynamics into Actionable Business Insights

ReviewSense:将客户评论动态转化为可操作的商业洞察

Siddhartha Krothapalli, Kartikey Singh Bhandari, Tridib Kumar Das, Praveen Kumar, Naveen Suravarpu, Pratik Narang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReviewSense通过整合聚类、LLM适应和专家评估,将客户评论转化为可操作的商业建议,提升业务增长和客户忠诚度。

Comments 11 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16101 2026-01-21 cs.AI cs.IR 77%

Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals

比零样本更差?一个评估RAG在误导检索中鲁棒性的事实核查数据集

Linda Zeng, Rithwik Gupta, Divij Motwani, Yi Zhang, Diji Yang

机构 * The Harker School(哈克尔学校) Irvington High School(艾尔文顿高中) Palo Alto High School(帕洛阿尔托高中) University of California Santa Cruz(加州大学圣克鲁兹分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAGuard是首个评估RAG系统在误导检索中鲁棒性的基准,揭示LLM在面对误导信息时的表现劣于零样本基线。

Comments Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏