arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2607.13940 2026-07-16 cs.AI 新提交 57%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13551 2026-07-16 cs.CL 新提交 57%

Cost-Pragmatic Quality Gating and Selection-Fusion Multi-Model Combiners for BioASQ Phases A+ and B

用于BioASQ A+和B阶段的成本实用质量门控和选择融合多模型组合器

Dima Galat, Marian-Andrei Rizoiu

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究针对BioASQ任务14B 2026系统,围绕检索弱时的重新检索及多模型答案组合展开。采用混合与代理驱动管道结合质量门控,成本实用策略提升效果。还分解多模型集成,解析器在召回方面表现出色,团队在初步排行榜上成绩优异。

Comments CLEF2026, BioASQ2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12835 2026-07-15 cs.CL 新提交 57%

Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

大语言模型能写出可靠的评分标准吗?实验复现的元评估

Hanhua Hong, Yizhi Li, Jiaoyan Chen, Luu Gia Huy, Sophia Ananiadou, Jung-jae Kim, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) IQuest Research(IQuest研究公司) ELLIS Manchester(ELLIS曼彻斯特) University of Information Technology, VNU(越南国家大学信息技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12278 2026-07-15 cs.CV cs.LG 新提交 57%

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

全切片图像多模态基准测试中的数据泄露审计

Wenhao Zhang, Zhongliang Zhou, John Kang, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Merck & Co., Inc.(默克公司)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究针对计算病理学中WSI VQA基准测试数据泄露问题,通过追踪标识符发现患者级和机构级泄露,证明其可从基础模型特征空间解码,导致准确率差距,当前评估无法区分推理与检索,最后给出无污染评估建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12085 2026-07-15 cs.AI 新提交 57%

Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking

实现对话代理的多维评估:一种具有选择性重新评估和模型基准测试的可扩展、受治理的管道

Niranjan Kumar M, Balaji Nagarajan, Karthik Nair, Faysal Satter, Nithin Surendran

机构 * Lowes(劳氏公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对零售对话代理评估难题,提出GenAI Evaluation管道,通过规范化等处理生产日志,能评估多维度指标。选择性重新评估提高效率,支持审计。每日处理约50000条记录,已评估超两百万次交互,取得较好分数和准确率。

Comments 14 pages, 1 figure of design of architecture and 2 tables exploring the results and benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11906 2026-07-15 cs.AI 新提交 57%

In-Context Reinforcement Learning under Non-Stationarity: A Survey

非平稳性下的上下文强化学习:一项综述

A Run, Ziluo Ding

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11751 2026-07-14 cs.CR cs.LG cs.MA 新提交 57%

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

当局部监测器遗漏组合性危害时:诊断多智能体系统中的分布式后门

Yibo Hu, Ren Wang

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究多智能体系统中分布式后门问题及局部监测器漏洞,提出可观测性边界概念,通过实验证明局部监测器在局部无害时会失效,还展示了特定监测器和门的效果,指出找到能暴露负载的表示形式是未解决问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交 57%

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11486 2026-07-14 cs.CL 新提交 57%

Communicating Chess Strategies in Natural Language

用自然语言传达国际象棋策略

Langyuan Cui, Chun Kai Ling, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 针对人类难以理解国际象棋引擎走法背后策略的问题,提出策略语言化任务,设计了策略语言化流程与评估框架,实验表明自然语言可有效传达策略信息,还得出了关于评估、描述及评估方式的一些见解。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11342 2026-07-14 cs.SE cs.AI 新提交 57%

Fail-Aware and Explainable Test Oracle Prediction

故障感知与可解释的测试预言机预测

Yue Zhao, Binish Tanveer, Jelena Zdravkovic

机构 * Department of Computer and Systems Sciences(计算机与系统科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对测试预言机构建难题,提出基于代码语言模型的FOCAL方法预测测试前缀成败,通过学习带标签数据、强调失败案例损失及基于行为证据预测,相比基线方法提升了未见过项目失败案例性能并提供更丰富解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11279 2026-07-14 cs.CL 新提交 57%

FAD-SA-GRU: Enhancing Hate Speech Detection in Algerian Dialect Through Feature-Augmented Self-Attention GRU Networks

FAD-SA-GRU:通过特征增强自注意力GRU网络增强阿尔及利亚方言中的仇恨言论检测

Sara Yakoubi, Ikram Khalfallah, Kenza Khelkhal, Dihia Lanasri

机构 * USTHB(阿尔及尔科学技术大学) ATM Mobilis Algiers(阿尔及尔移动ATM公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究阿尔及利亚方言社交媒体上的仇恨言论检测,提出FAD-SA-GRU混合架构,通过多嵌入融合结合多种语义表示,经自注意力增强GRU编码器检测。实验表明该方法在多指标上优于基线,有效提升低资源方言仇恨言论检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10972 2026-07-14 cs.AI 新提交 57%

From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth

从检查器到预测器:在延迟的地面真值下对模型生成的战略路线进行代码拥有的评估

Aleh Manchuliantsau

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究在地面真值延迟等情况下对模型生成战略路线的评估,提出RouteCast机制,通过模型提出候选路线等产生临时预测排名,后续结果评估预测,在回顾性试点中显示出一定区分能力,建立了可行性结果并揭示失败模式。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交 57%

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10380 2026-07-14 cs.CL 新提交 57%

CAFE: A Compound-AI Factorial Evaluation Framework

CAFE:一种复合人工智能因子评估框架

Fabian Lukassen, Christoph Weisser, Thomas Kneib, Alexander Silbersdorff

机构 * University of Göttingen(哥廷根大学) Bielefeld University of Applied Sciences and Arts (HSBI)(比勒费尔德应用科学与艺术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 CAFE是开源平台,用于复合人工智能系统评估。它将管道组件设为因子构建析因设计,运行配置并用模型评判器和人工评分。能归因质量差异,报告多种结果,还能解释组件影响,在问答管道验证有效,已发布为Python包和Web应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09908 2026-07-14 cs.CL cs.IR 新提交 57%

RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation

RouteRec:推荐代理选择与聚合的严格评估

Kaiji Zhou, Vladimir Kalmykov, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究在推荐系统异构代理选择中,RouteRec框架在成本约束下比较请求级硬选与项目级学习聚合,发现在MovieLens-1M数据集上,请求级选择粗糙,项目级聚合更有前景,不同聚合方式有不同效果。

Comments 8 pages, 7 figures. Accepted at AgentSearch 2026 (The First Workshop on Indexing, Retrieval, and Ranking of AI Agents), co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 57%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09230 2026-07-13 q-fin.TR cs.LG 新提交 57%

When Does Order Flow Matter? State-Dependent L2 Liquidity-State Transitions in Crypto Futures

订单流何时重要?加密期货中依赖状态的 L2 流动性状态转换

Joohyoung Jeon

机构 * Korea University(韩国大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究 2023 年至 2026 年币安加密期货,定义离散 L2 流动性状态转换任务,用事件聚类验证等评估模型。发现事件前 L2 流动性状态是重要预测信号,订单流在 L2 状态模型上分层才有价值,且不同符号表现不同,提出状态优先设计原则及评估协议。

Comments 8 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09456 2026-07-13 cs.LG 新提交 57%

Active rejection enables reliable generalization of universal machine-learning interatomic potentials

主动拒绝可实现通用机器学习原子间势的可靠泛化

Mingxiang Luo, Xinnan Mao, Lu Wang, Lei Bai, Feng Ding, Yuqiang Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Suzhou Laboratory(苏州实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 研究针对通用机器学习原子间势训练数据集受限问题,提出自适应多教师路由方法,通过校准预训练教师、估计结构-教师对可靠性来生成伪标签,提升模型性能和动力学鲁棒性,有效构建高保真uMLIPs数据系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09114 2026-07-13 cs.CV cs.AI cs.MM 新提交 57%

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

基于事件流的多模态视频异常检测:一个基准数据集和算法

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 57%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07762 2026-07-10 cs.LG math.OC 新提交 57%

Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives

从组合优化视角看可信机器学习:综述与研究展望

Thibaut Vidal, Julien Ferry

机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。

Comments 67 pages, 16 mathematical highlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06605 2026-07-09 cs.LG stat.ML 新提交 57%

A Quiet Failure in Calibrated Virtual Screening: Marginal Conformal Prediction Under-Covers the Minority Class, and a Class-Conditional Fix Recovers It

校准虚拟筛选中的一个隐性失败:边际共形预测对少数类覆盖不足,而类条件修复方法可恢复覆盖

Muhammadjon Tursunbadalov, Mustafojon Tursunbadalov

机构 * School of Science and Technology, Champions College Prep(科学与技术学院,冠军大学预科)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究发现在不平衡数据集上标准共形预测对少数类覆盖不足,通过守恒恒等式解释该现象。提出类条件共形预测可恢复少数类覆盖率,定位失败原因并给出诊断方法,还通过成本模型表明弃权可改变筛选效用,制定恢复可靠性的实用方案。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04758 2026-07-09 cs.AI 新提交 57%

AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization

AgenticPD:用于物理设计QoR优化的阶段感知智能体框架

Shuo Ren, Zijin Cheng, Yaohui Han, Libo Shen, Leilei Jin, Wanting Tian, Rongliang Fu, Chao Wang, Bei Yu, Tsung-Yi Ho

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对物理设计QoR优化难题,现有方法欠佳。提出AgenticPD框架,围绕物理设计流程阶段边界组织,利用Judge Agent引导搜索,阶段专用智能体借助本地工具做决策,提升优化效果。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31126 2026-07-09 cs.LG q-bio.QM stat.ML 新提交 57%

Can Tabular In-Context Learners Generalize to Biomolecular Property Prediction?

表格上下文学习器能否泛化到生物分子性质预测?

Davy Guan, Lu Zhang, Asiri Wijesinghe, Allen Zhu, He Zhao, Helen Power, F. Hafna Ahmed, Andrew Warden, Cheng Soon Ong, Daniel M. Steinberg

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文研究表格基础模型(如TabPFN3和TabICL)在生物分子性质预测中的泛化能力,发现其性能取决于所使用的序列或分子表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06074 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 57%

Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Development

Prompt Coach:软件开发中用于学习提示工程的智能导师的实证评估

Rohit Mehra, Kapil Singi, Vikrant Kaulgud, Vibhu Saujanya Sharma, Swapnajeet Gon Choudhury, Swati Sharma, Adam P. Burden, Majd Sakr

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, India(Accenture,印度) Accenture, USA(Accenture,美国)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对软件开发人员难以掌握的提示工程技能,提出智能导师Prompt Coach,通过苏格拉底式指导助其学习编写高质量代码生成提示,经实证研究,15名专业开发者参与,单次课程后有显著改进,提升了提示编写技能。

Comments 7 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (Industry Showcase Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05478 2026-07-08 cs.LG cs.PL 新提交 57%

InvWeaver: Deductive Feedback for Invariant Synthesis in Interacting-Loop Programs

InvWeaver:交互循环程序中不变式合成的演绎反馈

Guangyuan Wu, Weining Cao, Zehui Tan, Yuan Yao, Hengfeng Wei, Taolue Chen, Xiaoxing Ma

机构 * Nanjing University(南京大学) Hunan University(湖南大学) Birkbeck, University of London(伦敦大学伯贝克学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究针对交互循环程序的不变式合成难题,提出神经符号框架InvWeaver,通过循环级抽象等方法揭示循环间依赖并传播证明义务,在综合基准套件上评估,其性能显著优于现有方法,能有效解决多循环问题并保持单循环任务优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05411 2026-07-08 cs.CY cs.AI 新提交 57%

The GenAI Skill Bypass: Mapping Divergent Pathways of University Students and Staff AI Literacy

生成式人工智能技能绕过:绘制大学生和教职员工人工智能素养的不同路径

Eduardo Oliveira, Narelle English, Tracii Ryan, Kamila Misiejuk, Cory dal Ponte, Sonsoles López-Pernas, Mohammed Saqr

机构 * University of Melbourne(墨尔本大学) FernUniversität(费尔大学) University of Eastern Finland(东芬兰大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究大学生和教职员工GenAI素养路径差异,通过心理测量分析发现学生常先掌握高级创作再获基础理解,与学者路径不同且相关性弱,挑战“一刀切”课程,为诊断驱动干预提供依据。

Comments 18 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04774 2026-07-07 cs.LG 新提交 57%

MARLIN: De Novo Molecular Structure Elucidation from Tandem Mass Spectra without a Ground-Truth Formula

MARLIN:从串联质谱中进行从头分子结构解析,无需真实分子式

Xujun Che, Xiuxia Du, Depeng Xu

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究针对无分子式的串联质谱,提出MARLIN方法,通过自监督编码器和语言模型生成候选结构,用质量壳约束等确保准确性,在无真实分子式情况下表现出色,能可靠解析结构。

详情

展开后加载摘要…

URL PDF HTML 收藏