arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-30 至 2025-12-30 共收录 244 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 41 篇

2512.22183 2025-12-30 cs.CV cs.AI cs.CL 73%

Unbiased Visual Reasoning with Controlled Visual Inputs

通过受控视觉输入实现无偏视觉推理

Zhaonan Li, Shijie Lu, Fei Wang, Jacob Dineen, Xiao Ye, Zhikun Xu, Siyi Liu, Young Min Cho, Bangzheng Li, Daniel Chang, Kenny Nguyen, Qizheng Yang, Muhao Chen, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) University of Pennsylvania(宾夕法尼亚大学) University of California, Davis(加州大学戴维斯分校)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VISTA通过解耦感知与推理,利用受控接口和强化学习训练,提升了视觉推理的鲁棒性和中立性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI 70%

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22883 2025-12-30 cs.CR cs.AI 70%

Agentic AI for Cyber Resilience: A New Security Paradigm and Its System-Theoretic Foundations

面向网络韧性的代理AI:一种新的安全范式及其系统理论基础

Tao Li, Quanyan Zhu

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的网络韧性新范式,通过系统理论框架设计自主工作流,利用博弈论实现网络防御与攻击的动态平衡,提升系统在攻击下的持续适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21257 2025-12-30 cs.IR cs.CL 70%

ReaSeq: Unleashing World Knowledge via Reasoning for Sequential Modeling

ReaSeq:通过推理解锁世界知识用于序列建模

Jiakai Tang, Chuan Wang, Gaoming Yang, Han Wu, Jiahao Yu, Jian Wu, Jianwu Hu, Junjun Zheng, Longbin Li, Shuwen Xiao, Xiangheng Kong, Yeqiu Yang, Yuning Jiang, Ahjol Nurlanbek, Binbin Cao, Bo Zheng, Fangmei Zhu, Gaoming Zhou, Huimin Yi, Huiping Chu, Jin Huang, Jinzhe Shan, Kenan Cui, Longbin Li, Silu Zhou, Wen Chen, Xia Ming, Xiang Gao, Xin Yao, Xingyu Wen, Yan Zhang, Yiwen Hu, Yulin Wang, Ziheng Bao, Zongyuan Wu

机构 * TaoRank Team(TaoRank团队)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReaSeq通过引入世界知识增强推理,提升推荐系统在物品表示和用户兴趣建模上的性能,实现IPV、CTR、订单和GMV的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10516 2025-12-30 cs.CV cs.AI 70%

CogStream: Context-guided Streaming Video Question Answering

CogStream: 基于上下文的流视频问答

Zicheng Zhao, Kangyu Wang, Shijie Li, Rui Qian, Weiyao Lin, Huabin Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CogStream任务,通过视觉流压缩和历史对话检索,解决流视频中关键信息识别与问答问题。

Comments Project page: https://github.com/LiamZhao326/CogStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI 70%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22207 2025-12-30 cs.AI 70%

GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks

GamiBench: 通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力

Ryan Spencer, Roey Yaari, Ritvik Vemavarapu, Joyce Yang, Steven Ngo, Utkarsh Sharma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GamiBench通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力,引入新指标并揭示模型在复杂折叠任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23568 2025-12-30 cs.CV 67%

ThinkGen: Generalized Thinking for Visual Generation

ThinkGen: 用于视觉生成的通用思考

Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Bytedance Home(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23319 2025-12-30 cs.DB 67%

Flexible Keyword-Aware Top-$k$ Route Search

灵活的关键词感知Top-k路线搜索

Ziqiang Yu, Xiaohui Yu, Yueting Chen, Wei Liu, Anbang Song, Bolong Zheng

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出关键词感知top-k路线查询,通过探索与边界范式高效处理路线规划,满足用户对POI访问顺序、旅行预算和评分的多样化需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19683 2025-12-30 cs.CV 67%

From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

从室内到开放世界:揭示MLLMs中的空间推理差距

Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。

Comments Project page: https://mingrui-wu.github.io/openbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00115 2025-12-30 cs.CL cs.AI 62%

Cognitive Alignment in Personality Reasoning: Leveraging Prototype Theory for MBTI Inference

人格推理中的认知对齐:利用原型理论进行MBTI推断

Haoyuan Li, Yuanbo Tong, Yuchen Li, Zirui Wang, Chunhou Liu, Jiamou Liu

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 ProtoMBTI通过原型理论与认知对齐,提升文本人格推断的准确性和泛化能力。

Comments The authors have decided to withdraw this version to substantially revise and extend the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22944 2025-12-30 cs.LG 57%

Multiple Token Divergence: Measuring and Steering In-Context Computation Density

多令牌分歧:测量和引导上下文计算密度

Vincent Herrmann, Eric Alcaide, Michael Wand, Jürgen Schmidhuber

机构 * The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 多令牌分歧通过测量语言模型的计算努力,提供了一种轻量级工具,用于分析和引导生成文本的计算动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20981 2025-12-30 cs.CV cs.CL cs.RO 57%

RefAV: Towards Planning-Centric Scenario Mining

RefAV:面向规划导向的场景挖掘

Cainan Davidson, Deva Ramanan, Neehar Peri

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 RefAV通过视觉-语言模型改进场景挖掘,解决自动驾驶中复杂多智能体交互的定位问题。

Comments Project Page: https://cainand.github.io/RefAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23307 2025-12-30 cs.CR cs.IR 50%

RobustMask: Certified Robustness against Adversarial Neural Ranking Attack via Randomized Masking

RobustMask: 通过随机掩码实现对抗神经排序攻击的认证鲁棒性

Jiawei Liu, Zhuo Chen, Rui Zhu, Miaokun Chen, Yuyang Gong, Wei Lu, Xiaofeng Wang

专题命中 推理与问题求解 :language model(abstract)

AI总结 RobustMask通过结合预训练语言模型和随机掩码机制,提升神经排序模型对对抗扰动的鲁棒性,认证top-K鲁棒性并有效增强实际检索系统的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 36 篇

2502.01812 2025-12-30 cs.CL cs.LG 90%

SelfCheck-Eval: A Multi-Module Framework for Zero-Resource Hallucination Detection in Large Language Models

SelfCheck-Eval: 一个用于大型语言模型中零资源幻觉检测的多模块框架

Diyana Muhammed, Giusy Giulia Tuccari, Gollam Rabby, Sören Auer, Sahar Vahdati

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) L3S Research Center, Leibniz University Hannover(汉诺威莱布尼茨大学L3S研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 SelfCheck-Eval提出了一种多模块框架,专门用于检测大型语言模型在数学推理中的幻觉问题,通过三个独立模块提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22249 2025-12-30 cs.LG cs.CV 89%

Temporal Visual Semantics-Induced Human Motion Understanding with Large Language Models

基于大语言模型的时序视觉语义诱导的人体运动理解

Zheng Xing, Weibing Zhao

机构 * Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen(计算机科学与软件工程学院,深圳大学,深圳)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型提取时间视觉语义并整合到子空间聚类中,以提升人体运动分割性能的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22145 2025-12-30 cs.DL cs.AI cs.CY 89%

Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models

预审至同行评审:使用大型语言模型自动化评审的陷阱

Akhil Pandey Akella, Harish Varma Siravuri, Shaurya Rohatgi

机构 * AllSci Corp(AllSci公司) Sunwater Capital(Sunwater资本) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01967 2025-12-30 cs.CL cs.AI cs.HC 88%

Analyzing Cognitive Differences Among Large Language Models through the Lens of Social Worldview

通过社会世界观的视角分析大型语言模型的认知差异

Jiatao Li, Yanheng Li, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Information Management Department, Peking University(北京大学信息管理系) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社会世界观分类法分析大型语言模型的认知差异,揭示其在动态社会环境中的适应性与认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22306 2025-12-30 cs.CR cs.AI 88%

Beyond Single Bugs: Benchmarking Large Language Models for Multi-Vulnerability Detection

超越单一漏洞:为多漏洞检测大规模语言模型进行基准测试

Chinmay Pushkar, Sanchit Kabra, Dhruv Kumar, Jagat Sesh Challa

机构 * BITS Pilani(比斯·比兰迪大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出多漏洞检测基准测试,评估LLMs在不同漏洞密度下的性能,发现高密度下性能显著下降,尤其在Python和JavaScript中表现较差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23219 2025-12-30 cs.CV 88%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20933 2025-12-30 cs.SE 88%

Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code

大型语言模型代码设计能力的分层评估

Mootez Saad, Boqi Chen, José Antonio Hernández López, Dániel Varró, Tushar Sharma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了大型语言模型在代码设计能力上的分层表现,发现其在耦合性推理上易受噪声影响,而内聚性分析在受控环境下较稳健,但整体自主推理能力有限。

Comments 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23572 2025-12-30 cs.CL cs.CV 87%

Instruction-Following Evaluation of Large Vision-Language Models

大视觉-语言模型的指令遵循评估

Daiki Shiono, Shumpei Miyawaki, Ryota Tanaka, Jun Suzuki

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

AI总结 本研究评估了大视觉-语言模型在微调后的指令遵循能力,发现其能力下降并分析了原因,提出通过包含输出格式指示的训练数据集可缓解此问题。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12382 2025-12-30 cs.CL 87%

LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation

LLM-as-a-Judge: 快速评估法律文档推荐用于检索增强生成

Anu Pradhan, Alexandra Ortan, Apurv Verma, Madhavan Seshadri

机构 * Bloomberg(彭博)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本文提出LLM-as-a-Judge方法,通过改进评估指标和统计检验,实现法律文档推荐系统的自动化评估,提高评估效率和准确性。

Comments Accepted in EARL 25: The 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models at RecSys 2025

Journal ref Proceedings of the 2nd Workshop on Evaluating and Applying Recommender Systems with Large Language Models (EARL), RecSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 86%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21647 2025-12-30 cond-mat.mtrl-sci cs.LG 86%

Automated Machine Learning Pipeline: Large Language Models-Assisted Automated Dataset Generation for Training Machine-Learned Interatomic Potentials

自动化机器学习流水线:基于大语言模型的自动化数据集生成用于训练机器学习互作用势

Adam Lahouari, Jutta Rogal, Mark E. Tuckerman

机构 * NYU, Department of Chemistry(纽约大学化学系) Initiative for Computational Catalysis, Flatiron Institute(计算催化计划,Flatiron研究所) NYU, Department of Physics(纽约大学物理系) Courant Institute of Mathematical Sciences, NYU(数学科学学院,纽约大学) NYU-ECNU Center for Computational Chemistry(纽约大学-复旦大学计算化学中心) Simons Center for Computational Physical Chemistry, NYU(Simons计算物理化学中心,纽约大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的自动化机器学习流水线,用于生成训练数据集以提升机器学习互作用势的精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23684 2025-12-30 cs.CL cs.AI 86%

Multilingual Hidden Prompt Injection Attacks on LLM-Based Academic Reviewing

多语言隐藏提示注入攻击对基于LLM的学术评审的影响

Panagiotis Theocharopoulos, Ajinkya Kulkarni, Mathew Magimai. -Doss

机构 * International School of Athens(希腊国际学校) Idiap Research Institute(Idiap研究 institute)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,多语言隐藏提示注入攻击对LLM基于的学术评审系统产生显著影响,尤其在英语、日语和中文中表现明显,而阿拉伯语则影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22470 2025-12-30 cs.AI 85%

DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior

DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为

Sadia Asif, Israel Antonio Rosales Laguan, Haris Khan, Shumaila Asif, Muneeb Asif

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) National University of Sciences and Technology(国立科学与技术大学) School of Electrical Engineering & Computer Science(电子与计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00592 2025-12-30 cs.PL cs.DC cs.LG cs.PF 85%

Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization

代理自调度:LLM引导循环优化的实验研究

Massinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ComPilot框架,利用LLM与编译器闭环交互实现代码优化,实验表明其在循环优化中效果优于现有方法。

Comments Accepted at the 34th International Conference on Parallel Architectures and Compilation Techniques (PACT 2025). 12 pages, plus appendix

Journal ref 2025 34th International Conference on Parallel Architectures and Compilation Techniques (PACT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22650 2025-12-30 cs.LG cs.AI cs.CL 80%

Scaling Unverifiable Rewards: A Case Study on Visual Insights

扩展不可验证的奖励:视觉洞察的案例研究

Shuyu Gan, James Mooney, Pan Hao, Renxiang Wang, Mingyi Hong, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Selective TTS框架,通过多阶段流程优化提升视觉洞察质量,实现计算预算固定下的性能提升。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22257 2025-12-30 q-bio.QM 80%

LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science

LiveProteinBench: 一种无污染的基准测试,用于评估模型在蛋白质科学中的专用能力

Dingyi Rong, Zijian Chen, Qi Jia, Kaiwei Zhang, Haotian Lu, Guangtao Zhai, Ning Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 LiveProteinBench通过无污染的多模态基准测试,评估LLM在蛋白质科学中的专用能力,揭示了通用模型在零样本性能上的优势及多模态信息融合的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏