arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1423 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1423 篇

2603.23522 2026-08-21 cs.CL cs.AI 版本更新 87%

Qworld: Question-Specific Evaluation Criteria for LLMs

Qworld: 为LLMs设计的问题特定评估标准

Shanghua Gao, Yuchang Su, Pengwei Sui, Curtis Ginder, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26643 2026-08-20 cs.AI cs.LG 版本更新 87%

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

重新思考自进化:缓解技能过拟合的约束探索-利用过程

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体技能过拟合问题,提出SkillBoost三阶段框架,在23种模型-基准配置上达SOTA性能,优化后技能可跨智能体复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10875 2026-08-18 cs.CL cs.AI 版本更新 87%

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

VibeLifeBench:你的生命智能体能在真实生活环境中保持主动与持续性吗?

Xiaohongshu Dots Studio, Evolvent AI

机构 * Xiaohongshu Dots Studio(小红书Dots工作室) Evolvent AI(Evolvent AI公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VibeLifeBench基准,评估7个前沿LLM智能体在200项长周期日常生活任务中的表现,发现其主动与持续性不足,将开源相关任务、环境与评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14967 2026-08-07 cs.SE cs.AI cs.LG 版本更新 87%

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

MermaidSeqBench: 一种用于自然语言到Mermaid序列图生成的评估基准

Basel Shbita, Farhan Ahmed, Chad DeLuca

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MermaidSeqBench,通过混合方法构建132个样本,评估LLM生成Mermaid序列图的能力,揭示模型间显著能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10400 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 87%

Designing Service Systems from Textual Evidence

从文本证据设计服务系统

Ruicheng Ao, Hongyu Chen, Siyang Gao, Hanwei Li, David Simchi-Levi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PP-LUCB算法,通过结合LLM代理评分与逆倾向加权残差,有效解决服务系统配置选择中的偏见问题,实现高置信度与低成本审计的平衡。

Comments This submission is withdrawn because it duplicates arXiv:2601.21471 by the same authors. The expanded manuscript was submitted as a new entry instead of as a replacement, so the same paper is now indexed twice. No results, proofs, or data are retracted. The current version is maintained as a replacement of arXiv:2601.21471, which readers should cite

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 87%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09898 2026-06-23 cs.LG cs.AI 版本更新 87%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23851 2026-06-18 cs.CL cs.AI cs.SC 版本更新 87%

ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

ASyMOB:代数符号数学运算基准

Michael Shalyt, Rotem Elimelech, Ido Kaminer

机构 * MIT(麻省理工学院) Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。

Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新 87%

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05408 2026-08-18 cs.IR 版本更新 87%

Rich-Media Re-Ranker: A User Satisfaction-Driven LLM Re-ranking Framework for Rich-Media Search

多介质重排序:一种基于用户满意度的LLM重排序框架用于多介质搜索

Zihao Guo, Ligang Zhou, Zeyang Tang, Feicheng Li, Ying Nie, Zhiming Peng, Qingyun Sun, Jianxin Li

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出Rich-Media Re-Ranker框架,通过多维细粒度建模提升用户搜索满意度,整合丰富侧信息和视觉信号,通过多任务强化学习增强系统适应性,实验证明其优于现有方法。

Comments Accepted by the Full Research Track of CIKM-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13404 2026-08-17 cs.SE cs.CR 版本更新 87%

Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair

修复会破坏安全性吗?对迭代式大语言模型驱动的基础设施即代码修复中安全性退化的实证研究

Benjamin Agyekum, Fabio Santos

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究通过分析IaC-Eval基准的5968个场景,发现迭代式LLM驱动的IaC修复会引入约3.3%场景的安全退化,主要由资源重构导致,第3次迭代是最优停止点,为安全反馈设计提供指导。

Comments 20 pages, 3 figures, 5 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026). To appear in LIPIcs Vol. 394. v2: corrected the bibliographic record of one reference (preprint, not a journal article) and added the related-version link to the published LIPIcs article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 87%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15536 2026-08-07 cs.HC 版本更新 87%

'OpenBloom': A Stigma-Sensitive LLM Design Probe for Navigating Reproductive Well-being Conversations with Young Adults

「OpenBloom」:一种面向生殖健康的污名敏感型大语言模型设计探针

Yang Hong, Ashley Hua, Adya Daruka, Sharifa Sultana

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出OpenBloom,利用大语言模型将生殖健康文章转为问题提示,通过34名参与者的136次交互研究,探讨AI生成问题如何与社会污名、情境敏感性和反思性互动,并讨论女性主义HCI、可争议性和价值敏感AI框架的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22748 2026-08-07 econ.GN q-fin.EC 版本更新 87%

Nine Raters, One Index: Carrying LLM Disagreement into Labour-Market Estimates

英国就业对生成式人工智能的暴露程度如何?开发和应用一个基于任务的指数

Golo Henseke, Rhys Davies, Alan Felstead, Duncan Gallie, Francis Green, Ying Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文开发了生成式人工智能易感指数(GAISI),通过任务层面的数据衡量英国就业对大语言模型的暴露程度,发现多数岗位有一定程度的AI暴露,但仅有少数岗位高度暴露,且AI暴露对工资溢价的影响有所下降。

Comments 47 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15230 2026-08-04 econ.EM 版本更新 87%

EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data

EnergyAgentBench: 在实时能源基础设施数据上评估LLM代理的基准测试

Eliseo Curcio

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出EnergyAgentBench,首个基于实时电力市场数据的LLM代理基准测试,评估数据中心选址、长期投资组合优化等任务,九种模型在1414次运行中表现各异,Claude Sonnet 4.6在整体得分上领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00262 2026-07-22 cs.SE 版本更新 87%

LLM-Driven Cost-Effective Requirements Change Impact Analysis

基于大语言模型的低成本需求变更影响分析

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13347 2026-07-20 cs.CL cs.AI cs.LG 版本更新 87%

LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition

评估能力并不意味着优化效用:闭环表格识别中的大语言模型作为评判信号

Donghwan Kim

机构 * Aidentyx Inc.(艾登蒂克斯公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究闭环表格识别中LLM-as-a-judge的效用,发现其评判信号弱,无特定反馈也有严重损失,结构保留约束效果不佳,表明评估能力不意味着优化效用,迭代细化需确定性检测结构变化的验证信号。

Comments 32 pages, 9 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15212 2026-07-15 cs.CR 版本更新 87%

LLM vs. SAST: A Technical Analysis on Detecting Coding Bugs of GPT4-Advanced Data Analysis

大语言模型与SAST:关于GPT4-高级数据分析编码漏洞检测的技术分析

Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究对比GPT-4与两个SAST工具在32个安全场景的编码漏洞检测,用二元规则评分、逻辑或基线聚合结果,经McNemar检验,发现GPT-4检测性能更优,还讨论了将其集成到安全软件开发工作流程的相关要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08242 2026-07-07 cs.HC 版本更新 87%

Bringing Everyone to the Table: An Experimental Study of LLM-Facilitated Group Decision Making

让每个人都参与进来:关于大语言模型辅助群体决策的实验研究

Mohammed Alsobay, David M. Rothschild, Jake M. Hofman, Daniel G. Goldstein

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型辅助群体决策,通过随机实验,比较无辅助、一次性信息共享提示、人类辅助和大语言模型辅助四种条件下完成隐藏档案任务的情况,发现大语言模型辅助能增加信息共享,且成本有限,还开源数据和平台。

Comments To appear at ACM CSCW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17838 2026-06-29 cs.SE 版本更新 87%

Using Mutation-Analysis to Examine an LLM's Ability to Summarize Code

使用变异分析检验大语言模型总结代码的能力

Lara Khatib, Michael Pu, Bogdan Vasilescu, Meiyappan Nagappan

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 提出基于变异分析的评估方法,通过注入代码突变并检查摘要是否更新,测试LLM摘要是否反映实际行为;实验表明摘要准确率随复杂度下降,模型常描述意图而非行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03505 2026-06-16 cs.SE 版本更新 87%

LATS-RCA: Language Agent Tree Search for Root Cause Analysis in Microservices

LATS-RCA:面向微服务根因分析的语言智能体树搜索

Alexander Naakka, Yuqing Wang, Mika V Mäntylä

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出LATS-RCA方法,将根因分析建模为反射引导的树结构搜索,通过多智能体迭代分析日志和指标,在微服务系统中实现91.3%的诊断准确率,并验证了模型无关性。

Comments Accepted at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16384 2026-06-10 cs.SE 版本更新 87%

SemOpt: LLM-Driven Code Optimization via Rule-Based Analysis

SemOpt: 基于规则分析的LLM驱动代码优化

Yuwei Zhao, Yuan-An Xiao, Qianyu Xiao, Zhao Zhang, Yingfei Xiong

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出SemOpt框架,通过静态程序分析识别代码段、检索优化策略并生成优化结果,在C/C++和Python任务上显著提升优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01060 2026-06-09 cs.CL cs.AI cs.LG 版本更新 87%

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') IIIT Delhi, India(德里印度理工学院) Amazon, USA(美国亚马逊) Meta, USA(美国Meta) Apple, USA(美国苹果)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04180 2026-08-19 cs.LG 版本更新 86%

A Comparative Study of Feature Selection Methods for EHR Diagnosis Codes in Opioid Use Disorder Prediction

阿片类药物使用障碍预测中用于电子健康记录诊断代码的特征选择方法对比研究

Zihan Ding, Yinan Liu, Tengfei Ma, Rachel Wong, Xia Zhao, Richard N. Rosenthal, Fusheng Wang

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) University of Vermont(佛蒙特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究对比五种特征选择方法在阿片类药物使用障碍预测中的表现,发现NTK敏感性方法在准确性与稳定性间平衡最优,LLM引导选择可提供互补临床信号。

Comments Accepted at the AMIA 2026 Annual Symposium. Author list corrected to match the accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14267 2026-08-13 cs.AI cond-mat.mtrl-sci 版本更新 86%

DREAMS: Density Functional Theory Based Research Engine for Agentic Materials Simulation

DREAMS:基于密度泛函理论的智能体材料模拟研究引擎

Ziqi Wang, Hongshuo Huang, Hancheng Zhao, Changwen Xu, Shang Zhu, Jan Janssen, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国) Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国) Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于DFT的分层多智能体框架DREAMS,通过多层安全防护提升LLM智能体材料模拟的可信度,在Sol27LC基准等任务中表现优异,可平衡可信度与成本,推动自主材料模拟发展。

Comments 47 pages, 44 pages of Supporting Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30412 2026-08-11 cs.CY cs.AI 版本更新 86%

Can LLMs Rank? A Tale of Triads and Triage

LLM能排序吗?三元组与分诊的故事

Gaurab Pokharel, Shafkat Farabi, Patrick J. Fowler, Sanmay Das

机构 * Virginia Tech(弗吉尼亚理工大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 研究LLM作为排序裁判的可靠性,提出用循环三元组计数和排序距离度量一致性,并在无家可归者住房分配和急诊分诊任务中验证。

Comments Accepted to the Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 86%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02594 2026-08-11 cs.AI 版本更新 86%

ACEvo: Adversarial Co-Evolution of Problem Distributions and Solvers for Combinatorial Optimization

ACEvo:面向组合优化的问题分布与求解器的对抗协同进化

Ruibo Duan, Yuxin Liu, Haoran Ye, Xinyao Dong, Zhiqiang Xu, Chenglin Fan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出ACEvo框架,通过LLM迭代协同进化启发式求解器与问题生成器,在TSP等组合优化问题上生成更具挑战性的实例分布,所得求解器在分布偏移下性能优于静态训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15974 2026-08-04 cs.CL 版本更新 86%

A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

面向对话摘要的大规模多维度LLM实证研究

Weixiao Zhou, Gengyao Li, Junnan Zhu, Xianfu Cheng, Feifei Zhai, Zhoujun Li

机构 * CCSE, Beihang University(北京航空航天大学CCSE) MAIS, CASIA(中国科学院自动化研究所MAIS) Fanyu AI Laboratory(帆禹AI实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 提出OmniCSEval基准,包含1800个跨六场景的对话,评估28个LLM在对话摘要中的完整性、简洁性和忠实性,揭示推理能力与模型规模的影响。

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 86%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);foundation model(abstract);prompting(abstract)

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏