arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 31 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 31 篇

2606.07867 2026-08-28 cs.CL 版本更新 85%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract_cn);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

Comments Accepted to EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26222 2026-08-28 cs.LG cs.AI cs.CR cs.SE 新提交 84%

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz:面向大语言模型安全评估的安全神经元引导模糊测试

Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

机构 * University of Bristol(布里斯托尔大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 NeuronFuzz是一种安全神经元引导的LLM安全评估白盒模糊测试框架,通过利用安全神经元激活值生成反馈,在21个模型上实现了高越狱发现率和零样本迁移能力,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-28 cs.CV cs.AI 版本更新 83%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02950 2026-08-28 cs.CL cs.AI cs.HC 版本更新 81%

Distinct Profiles of Run-to-Run Score Reliability and Expert-Panel Alignment Across Four LLM Evaluators of Simulated Japanese-Language AI-to-AI Counseling

固定合成日语咨询对话中的结构化提示与自动评估

Keita Kiuchi, Yoshikazu Fujimoto, Hideyuki Gotō, Tomonori Hosokawa, Makoto Nishimura, Yōsuke Satō, Izumi Sezai, Tomohiro Inoue

机构 * Japan National Institute of Occupational Safety and Health(日本国立职业安全卫生研究所) Kaze To Taiyo(凯泽・太阳) Saga Occupational Health Association(Saga职业健康协会) Department of Pharmacy, Zikei Hospital/Zikei Institute of Psychiatry(药剂科,Zikei医院/Zikei精神医学研究所) Department of Medical Welfare, Suzuka University of Medical Science(医疗福祉科, Suzuka医科大学) Graduate School of Human Sciences, Ritsumeikan University(人类科学研究生院,立命馆大学) Faculty of Nursing, National Defense Medical College(护理学部,国家防卫医疗大学) Support Center for Students with Disabilities, Aoyama Gakuin University(残疾学生支持中心,上智大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过人工智能生成的18份固定日语咨询对话记录,对比GPT - minimal、GPT - SMDP和Claude - SMDP三种情况,咨询专家与新的语言模型分别评级,发现SMDP对话在多方面获更高专家评级,语言模型评级可重复但偏宽松。

Comments 55 pages, 2 figures, 31 tables; supplemental material included; data and code at this https URL (https://doi.org/10.5281/zenodo.22106028;) preregistration and amendments at this https URL (https://doi.org/10.17605/OSF.IO/VU286)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26162 2026-08-28 cs.AI 新提交 79%

A Safety-Gated Multimodal AI Backend for Mental-Health Support: Hierarchical State Representation, Conservative Risk Fusion, and Controlled Generation in Anian

用于心理健康支持的安全门控多模态AI后端:Anian中的分层状态表示、保守风险融合与受控生成

Lei Wang, Xiao Wang, Lei Li

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出用于围产期心理健康支持的安全门控多模态AI后端Anian,其通过分层状态表示与保守风险融合实现安全门控,原型在多任务评估中表现优异,验证了框架内部可行性。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26195 2026-08-28 cs.SE 新提交 78%

Cost-Utility Alignment in LLM Agent Trajectories:Profiling,Attribution,Diagnosis,Adaptation,and Evaluation

大语言模型智能体轨迹中的成本-效用对齐:分析、归因、诊断、适配与评估

Dan Liu, Jian Li

专题命中 安全评测 :alignment(title,abstract)

AI总结 本研究提出以轨迹为中心的成本-效用对齐框架,通过五阶段分析解决LLM智能体资源消耗与任务贡献不匹配问题,为资源感知的智能体设计部署提供结构化基础。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-28 cs.CL 版本更新 77%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26109 2026-08-28 cs.AI 新提交 70%

Standalone LLM and a Pre-specified Agentic Pipeline for Explaining ICU Mortality Predictions: a Feasibility Study on the eICU Demo Dataset

独立大型语言模型(LLM)与预定义智能体管道用于解释ICU死亡率预测:基于eICU演示数据集的可行性研究

Di Zhu, Chen Xie, Haoyun Zhang, Zihan Wei, Ziwei Wang, Jiazhao Shi, Ziyu Wang, Qiyang Xie

机构 * Santa Clara University(圣克拉拉大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Wake Forest University(维克森林大学) Northeastern University(东北大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究基于eICU演示数据集对比独立LLM与四步智能体管道解释ICU死亡率预测,发现智能体管道在指南依据性等方面更优,但需搭配归因核查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23705 2026-08-28 cs.CL cs.AI cs.CY 版本更新 67%

The Limits of Automatic Evaluation of Creativity in Large Language Models

大型语言模型创造力自动评估的局限性

Alessandro Tutone, Giorgio Franceschelli, Mirco Musolesi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究发现,当前自动评估方法及LLM作为评判者的评估方式,与人类对LLM生成文本创造力的判断存在显著不一致,无法有效捕捉创造力的关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22203 2026-08-28 cs.LG cs.AI cs.CL 版本更新 67%

From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning

从准确率到鲁棒性:数学推理中基于规则与基于模型的验证器研究

Yuzhen Huang, Weihao Zeng, Xingshan Zeng, Qi Zhu, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以数学推理为案例,分析了基于规则与基于模型的验证器在静态评估和RL训练中的表现,发现两类验证器分别存在误拒和奖励黑客问题,为开发更优RL奖励系统提供了参考。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-28 cs.CL cs.AI 新提交 62%

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 22 pages, 9 figures (4 main body, 5 appendix), 11 tables (1 main body, 10 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26137 2026-08-28 cs.CL cs.LG cs.SD 新提交 62%

Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores

可解释、经公平评估且超越单人类天花板的L2口语自动评估模型——以及为何停顿编码不改变LLM流利度评分

Eichi Uehara

机构 * Aflo Technologies Inc.(Aflo科技公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 该研究构建了可解释的特征+LLM混合L2口语评估模型,其评分超越81%的人类评分者,还证实停顿编码不影响LLM流利度评分,且通过多维度方法验证了模型的公平性与可靠性。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-08-28 cs.LG cs.AI 版本更新 62%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

Comments Extended version of a paper that appeared in Artificial Intelligence in Medicine 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-08-28 cs.CL cs.AI cs.IR 版本更新 62%

LLM-Specific Utility for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-08-28 cs.CL cs.AI 版本更新 62%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Diola Dsouza, Ruiwen Guan, Oana Ignat

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27127 2026-08-28 cs.AI 新提交 57%

TransMeme: A Multi-Agent Framework for Cross-Cultural Meme Transcreation

TransMeme:用于跨文化梗图再创作的多智能体框架

Jingyi Zheng, Yule Liu, Zifan Peng, Tianyi Hu, Yuemeng Zhao, Xinhu Zheng, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) Aarhus University(奥胡斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究针对跨文化梗图再创作的三大核心挑战,提出多智能体框架TransMeme,经中英双向梗图再创作的人工评估与LLM评判,性能优于所有基线,为该领域未来幽默迁移研究指明方向。

Comments 10 pages, 4 figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27110 2026-08-28 cs.CL 新提交 57%

DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali

DocTalkBN:孟加拉语专家远程医疗对话的新型数据集

Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi, Ananya Shahrin Promi, Wahid Al Azad Navid, Rifat Shahriyar

机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究针对低资源语言孟加拉语医疗对话数据稀缺问题,构建了DocTalkBN多模态数据集,含大量真实远程医疗对话数据,并设置三项下游任务进行基准测试,为医疗NLP研究提供实用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交 57%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26119 2026-08-28 cs.CL 新提交 57%

DeflectBench: A Benchmark for Evaluating Rhetorical Fallacy Generation in LLMs

DeflectBench:评估大语言模型中修辞谬误生成的基准

Art Kanke

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 DeflectBench评估四个前沿大语言模型在三种修辞谬误生成任务中的表现,发现拒绝率主要由提示框架和谬误类型决定,教育辩论教练提示可大幅降低拒绝率,且各模型的合规行为分布存在差异。

Comments 15 pages. Accepted at the CTB, FAGEN, and AI4GOOD workshops at ICML 2026 in Seoul, South Korea. Code and dataset: this https URL (https://github.com/ArtKanke/DeflectBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21832 2026-08-28 cs.CL 版本更新 57%

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24845 2026-08-28 cs.IR cs.AI 版本更新 57%

REPREC: Representation Driven Parameter-Efficient Recommendation System

REPREC:表示驱动的参数高效推荐系统

Harshini Kavuru, Dwipam Katariya, Giri Iyengar, Pranab Mohanty, Kalanand Mishra, Raghu Machiraju

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究基于大语言模型的序列推荐,提出REPREC轻量级框架,通过轻量级用户表示对齐和MLP注入器映射用户嵌入,在多基准数据集实验中优于LoRA,能保持性能并降低训练时间,平衡推荐质量与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12984 2026-08-28 cs.CL 版本更新 57%

SkillChain: Closing the Loop on Skill Evolution for Image-Based E-Commerce AI Assistants

SkillChain: 为基于图像的电商AI助手闭环技能演化

Yimin Hu, Mengtao Xu, Hao Guo, Yuheng Song, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出SkillChain框架,通过技能创建、路由优化和主体精炼三阶段自动化技能生命周期,解决电商图像助手多意图混淆问题,显著提升响应质量和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-08-28 cs.AI 版本更新 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11326 2026-08-28 cs.CV cs.AI 版本更新 57%

Temporally-Grounded Language Generation: Towards Real-Time Vision-Language Models

时间接地语言生成:迈向实时视觉-语言模型

Keunwoo Peter Yu, Joyce Chai

机构 * Computer Science and Engineering Division University of Michigan(计算机科学与工程系大学米歇尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对实时交互环境对视觉-语言模型的时间精确性要求,提出TGLG基准任务及TRACE指标,构建VLM-TSI模型,实验显示其性能优于强基线但仍有提升空间。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26462 2026-08-28 cs.LG cs.AI cs.CL 新提交 56%

Diff Mining: Logit Differences Reveal Finetuning Objectives

Diff Mining:对数差揭示微调目标

Greg Kocher, Robert West, Clément Dumas, Julian Minder

机构 * EPFL(洛桑联邦理工学院) ENS Paris-Saclay(巴黎萨克雷高等师范学校) Université Paris-Saclay(巴黎萨克雷大学) MATS

专题命中 安全评测 :分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 提出Diff Mining框架,通过对比微调模型与基础模型的对数来识别微调目标,在微调领域检测、偏见识别等任务上优于现有方法,可用于开发微调审计工具。

Comments 37 pages, 7 figures. ICLR 2026 Workshop: Principled Design for Trustworthy AI. Code available at this https URL (https://github.com/science-of-finetuning/diffing-toolkit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26519 2026-08-28 cs.CE cs.SE 新提交 50%

Report of the 2026 Workshop on Next-Generation Ecosystems for Scientific Computing: Harnessing Community, Software, and AI for Cross-Disciplinary Team Science

2026年科学计算下一代生态系统研讨会报告:利用社区、软件与AI推进跨学科团队科学

Lois Curfman McInnes, Dorian Arnold, Prasanna Balaprakash, Mike Bernhardt, Franck Cappello, Beth Cerny, Deborah DiazGranados, Anshu Dubey, Nichole Etienne, Roscoe Giles, Diego Gomez-Zara, Denice Ward Hood, Mary Ann Leung, Vanessa Lopez-Marrero, Olivia B. Newton, Irene Qualters, Keita Teranishi, Stefan M. Wild, Gabrielle Allen, Richard Arthur, Alexandra Ballow, Tony Baylis, David E. Bernholdt, Daniel Bielich, Johanna Cohoon, Jeremy Crampton, Charles Ferenbaugh, Stephen M. Fiore, Thomas Herault, Tanzima Islam, Stephen Jacobsohn, Meifeng Lin, Charles Lively, Satoshi Matsuoka, Stasa Milojevic, Daniel Nichols, Chris Oehmen, Santiago Ospina Tabares, Michael E. Papka, Katherine Riley, Damian Rouson, Sudip K. Seal, Brittany Segundo, John Shalf, Andrew Siegel, Valerie Taylor, Jim Willenbring, Lou Woodley

专题命中 安全评测 :trustworthy(abstract)

AI总结 本报告梳理2026年科学计算下一代生态系统研讨会成果,明确四大战略主题及八项社区行动优先事项,为AI时代构建可信可持续的科学计算生态系统指明方向。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26382 2026-08-28 cs.CV 新提交 50%

VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology

VIPER:用于兽医病理学视觉语言模型的专家策划基准

Luca L. Weishaupt, Simone de Brot, Javier Asin, Llorenç Grau-Roma, Nic G. Reitsam, Andrew H. Song, Dongmin Bang, Stefan T. Kaluziak, Long Phi Le, Jakob Nikolas Kather, Faisal Mahmood, Guillaume Jaume

机构 * Harvard-MIT HST(哈佛-麻省理工卫生科学与技术部) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) COMPATH, University of Bern(伯尔尼大学COMPATH) UC Davis(加州大学戴维斯分校) University of Augsburg(奥格斯堡大学) UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) TU Dresden(德累斯顿工业大学) University of Lausanne(洛桑大学)

专题命中 安全评测 :safety(abstract)

AI总结 研究针对现有病理视觉语言模型基准聚焦人体组织的问题,推出首个兽医病理学视觉语言模型评估基准VIPER,测试16类模型发现领域差距,验证领域特定训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-08-28 cs.IR 版本更新 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 安全评测 :alignment(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-28 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏