MuDRiC: Multi-Dialect Reasoning for Arabic Commonsense Validation
MuDRiC:多方言推理用于阿拉伯常识验证
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 MuDRiC通过引入多方言阿拉伯语常识数据集和图卷积网络方法,提升阿拉伯语常识验证性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
MuDRiC:多方言推理用于阿拉伯常识验证
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 MuDRiC通过引入多方言阿拉伯语常识数据集和图卷积网络方法,提升阿拉伯语常识验证性能。
SGDrive: 场景到目标层次化世界认知用于自动驾驶
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Li Auto Inc.(利汽车公司) ; Tongji University(同济大学) ; University of Surrey(Surrey大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 SGDrive通过构建驾驶特定的知识层次结构,改进了视觉语言模型在自动驾驶中的轨迹规划能力,实现了在导航模拟基准上的最佳性能。
一种具有视觉提示的视觉-语言-动作模型用于越野自动驾驶
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出OFF-EMMA模型,通过视觉提示和COT-SC策略提升越野自动驾驶轨迹规划的准确性和鲁棒性。
VIPER Strike: 通过结构化视觉-语言推理击败视觉推理验证码
机构 * City University of Macau(澳门城市大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)
专题命中 推理与问题求解 :LLM(abstract)
AI总结 ViPer通过结构化视觉-语言推理框架,有效解决视觉推理验证码问题,实现高达93.2%的成功率,优于现有方法,同时提出TSR策略提升防御效果。
Comments Accepted by Usenix Security 2026
MLB:面向临床应用的大型语言模型评估场景驱动基准
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Health Information Center of Zhejiang Province(浙江省健康信息中心) ; Peking University(北京大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。
Comments 11 pages, 4 figures, 5 tables
大语言模型能否理解、推理并生成混合语言文本?
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文通过CodeMixQA基准测试评估大语言模型在理解、推理和生成混合语言文本方面的能力,揭示了模型在混合语言环境中的局限性,并提供了改进多语言LLMs的见解。
Comments Preprint
mind_call: 一个用于大语言模型心理健康新功能调用的数据集
机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。
通过提示优化的大型语言模型评估自动标注方法在分类学命名中的应用
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文通过提示优化的大型语言模型评估了自动标注方法在分类学命名中的可行性,发现其在形态、地理和人名类别中表现良好,但在生态与行为及文化背景类别中存在挑战。
Comments This paper was accepted by IEEE IAICT
针对有限噪声数据的大型语言模型:引力波识别研究
机构 * Institute of Fundamental Physics and Quantum Technology(基础物理与量子技术研究所) ; School of Physical Science and Technology(物理科学与技术学院) ; School of Mathematics and Physics(数学与物理学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究通过引力波识别实验表明,大型语言模型在有限噪声和标注数据下能高效提取结构,优于传统神经网络。
Comments 10 pages, 5 figures, submitted to ApJ
基于大语言模型代理的终身学习:路线图
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。
Comments Accepted to IEEE TPAMI
VideoLoom:一种用于联合空间-时间理解的视频大语言模型
机构 * Fudan University(复旦大学) ; University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。
Meta-Fair: 大型语言模型的AI辅助公平性测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 Meta-Fair通过元测试法和LLM能力,实现大型语言模型的自动化公平性测试,揭示偏见并提高评估一致性。
从隐式到显式:提升大语言模型的自我认知能力
机构 * College of Information and Electrical Engineering, China Agricultural University(信息与电气工程学院,中国农业大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CoSur框架,通过改进大语言模型的隐式自我认知能力,在个体呈现范式下提升其自我识别性能。
MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估
机构 * University of Notre Dame(诺丁汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Montreal(蒙特利尔大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。
Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings
CrossTrafficLLM: 一种面向人类的基于大语言模型的可解释交通智能框架
机构 * Beijing Key Laboratory of Multimedia and Intelligent Software Technology(北京多媒体与智能软件技术重点实验室) ; Beijing Artificial Intelligence Institute(北京人工智能研究院) ; Faculty of Information Technology(信息科技学院) ; Beijing University of Technology(北京工业大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 CrossTrafficLLM通过结合大语言模型与图卷积网络,实现交通预测与自然语言生成的统一,提升交通智能的可解释性和实用性。
SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准
机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。
Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices
超越可重复性:令牌概率揭示大语言模型非确定性
机构 * Politecnico di Milano(米兰理工学院) ; Information Processing and Telecommunications Center ETSI de Telecomunicación, Universidad Politécnica de Madrid(信息处理与电信中心,马德里理工大学) ; University of Electronic Science and Technology of China(电子科学与技术大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文研究了大语言模型在非确定性下的令牌概率变化,发现非确定性对生成文本的影响显著,且可通过单次推理分析令牌概率来估计其影响。
PriceSeer:实时股票预测中大型语言模型的评估
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 PriceSeer通过实时动态数据评估LLMs在股票预测中的性能,提供数据无污染的基准测试及六种先进模型的多时间范围预测分析。
Comments 7 pages, 6 figures
评估大型语言模型在企业应用中的鲁棒性:跨格式和语言的扰动一致性基准测试
机构 * ServiceNow
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出跨格式和语言的扰动一致性基准测试,评估大型语言模型在企业应用中的鲁棒性,发现模型大小与鲁棒性关系复杂,8B参数模型表现各异。
基于生成式人工智能和大语言模型的网络威胁检测与漏洞评估系统
专题命中 评测与基准 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于RoBERTa模型的网络威胁检测系统,通过加密数据和生成令牌提升检测准确率,优于传统BERT模型。
对LLM-as-a-Reviewer的改写对抗攻击
机构 * MBZUAI(马克斯·普朗克人工智能研究所)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种针对LLM作为评审员的改写对抗攻击方法,通过优化生成改写序列以提高评审评分,同时保持语义和语言自然性,并验证了其有效性及潜在的检测信号。
大型语言模型是否易受偏好削弱攻击(PUA)攻击?一种诊断偏好对齐与现实有效性之间权衡的因子分析方法
机构 * School of Artificial Intelligence, OPtics and ElectroNics, Northwestern Polytechnical University(人工智能学院、光学与电子学院、西北工业大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; School of Economics and Management, Guangxi Normal University(经济管理学院,广西师范大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出了一种因子分析方法,用于诊断LLM在偏好对齐与现实有效性之间的权衡,揭示了高级模型可能更易受操纵性提示攻击,并强调了定制防御的重要性。
Comments preprint
ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。
Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/
以部署为中心的基础设施即代码生成:通过LLM赋能的DevOps模拟实现失败、学习、细化和成功
机构 * Australian National University Canberra Australia ; New York University \& Columbia University USA ; Nanyang Technological University Singapore ; Australian National University Australia ; Australian National University ; New York University \& Columbia University ; Nanyang Technological University
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出IaCGen框架,通过迭代反馈机制提升IaC模板的部署性,实验表明其在10次迭代内可使模板部署成功率提升至91.6%,并进一步通过人工反馈将性能提升至90%以上。
Comments Accepted by FSE 2026
Think-J: 生成式大语言模型作为评判者的学习思考
机构 * \dagger(机构2)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 Think-J通过学习思考方式提升生成式LLM作为评判者的性能,利用强化学习优化判断轨迹,无需额外标注即可超越现有方法。
Comments Accepted by AAAI2026
FROAV:一个用于RAG观察和代理验证的框架——降低LLM代理研究的门槛
机构 * AetheTech
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 FROAV提供了一个开源平台,通过可视化工作流编排、评估框架和Python集成,降低LLM代理研究的门槛,使研究人员能更专注于算法创新。
Comments 8 pages, 1 figure, 3 tables
LLMRouterBench: 一个大规模基准和统一框架用于LLM路由
机构 * Northwestern Polytechnical University(西北工业大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 LLMRouterBench通过大规模基准和统一框架评估LLM路由方法,揭示了模型互补性、性能-成本权衡及路由方法的局限性。
超越BeautifulSoup:为日常用户评估基于LLM的网络爬虫基准测试
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文评估了基于LLM的网络爬虫在日常用户中的应用,展示了端到端LLM代理如何使复杂爬虫变得简单,同时比较了LLM辅助脚本和端到端代理在不同场景下的效果。
法律中的LLM代理:分类、应用与挑战
机构 * Carnegie Mellon University(卡内基梅隆大学) ; National University of Singapore(国立新加坡大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; The University of Chicago(芝加哥大学) ; Rutgers University(罗格斯大学) ; Columbia University(哥伦比亚大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。
迈向更安全的AI审核:通过统一基准数据集评估LLM审核员并倡导以人类为中心的方法
机构 * Fordham University(福特汉姆大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过统一基准数据集评估LLM审核性能,提出SafePhi在道德判断上优于现有模型,强调需引入人类反馈提升审核可靠性。