ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis
ContraPrompt通过对比推理轨迹优化Prompt,显著提升LLM在复杂任务上的性能。
- 提出ContraPrompt方法,利用成对推理轨迹进行Prompt优化。
- 无需人工标注,自动生成对比数据。
共 316 篇论文
ContraPrompt通过对比推理轨迹优化Prompt,显著提升LLM在复杂任务上的性能。
Prism提出了一种基于符号表示的张量程序超级优化方法,显著提升了性能。
提出MEv-SINDy,通过单次激励时间序列学习,预测非线性动力学系统的全局频率响应曲线。
提出一种基于切片Kantorovich势的摊销最优传输方法,加速求解重复OT问题。
提出首个自进化逻辑综合框架,利用LLM智能体自主改进ABC源代码,提升综合质量。
Atropos通过预测早期终止和模型热切换,优化了基于LLM Agent的成本效益。
提出Autogenesis协议,实现LLM Agent系统的自进化,提升长期任务处理能力。
R$^2$A攻击通过优化对抗后缀,诱导黑盒LLM路由器选择高成本模型。
DLink通过层级知识蒸馏和频谱对齐,有效压缩脑电图(EEG)基础模型,降低计算成本。
提出了混合专家流匹配(MoE-FM)框架,加速非自回归语言模型推理。
Dr.~RTL提出了一种基于Agent的RTL优化框架,通过自学习优化PPA。
提出AC/DC框架,通过模型和任务的协同进化,发现具备多样化能力的新型LLM。
提出双轴生成式奖励模型,提升交互式对话模型在语义和时序上的鲁棒性,并用于强化学习。
GenRec是一个面向偏好的生成式推荐框架,通过优化训练和预填充策略,提升推荐效果。
研究表明,强化学习能显著扩展LLM Agent在复杂工具使用任务上的能力边界。
比较静态压缩和动态早退方法在边缘设备上的CNN优化,并探索其组合的优势。
提出基于神经架构搜索的自动化MR序列设计框架,无需先验知识,探索非传统序列。
TREX提出了一种基于多智能体和树搜索的LLM自动微调系统,性能优于传统方法。
论文将steering视为一种模型适应方法,并构建统一的适应方法分类体系。
提出TIP框架,通过熵和teacher-student差异性选择token,提升On-Policy Distillation效率。
该论文利用MDP框架优化T20板球比赛中的击球顺序和投球计划,提高胜率。
论文提出了一种基于随机神经网络(RaNNs)的框架,用于求解中子输运等积分-微分方程。
UI-Copilot通过协同框架和工具集成策略优化,提升了MLLM在长程GUI自动化任务中的性能。
该论文分析了大模型奖励信号利用的机制,提出Proxy Compression Hypothesis解释奖励破解现象。
该论文回顾了深度学习优化算法的演进,并进行了全面评估,总结了关键趋势和权衡。
提出一种无需人工标注的循环一致搜索(CCS)框架,用于训练信息检索任务中的搜索Agent。
提出BEAM算法,通过双层优化和自适应记忆机制,提升LLM在启发式算法设计中的性能。
TCL利用持续学习优化张量程序,实现跨硬件平台的高效快速优化。
提出了一种基于LoRA的快速自适应RFF提取框架,用于开放集无线信道环境下的设备认证。
论文提出Triton数据集和渐进式课程学习,提升Web导航Agent的鲁棒性和泛化能力。
研究表明,在线强化学习下,安全训练对LLM有害错位的影响取决于环境设计,模型大小起到安全缓冲作用。
提出一种统一可配置的CPU矩阵扩展架构,降低硬件开销并提升AI模型性能。
MISE通过后见之明自评估和互信息校准,解决了LLM智能体强化学习中的稀疏奖励问题。
提出了一种参数量极少的变分测量量子计算模型,用于生成建模,克服了传统模型参数量大的问题。
Relax是一个异步强化学习引擎,专为大规模全模态后训练设计。
提出TCER方法,通过纠正平凡偏差,提升开放式文本生成的质量和多样性,无需外部监督。
提出ContextCurator框架,通过强化学习主动管理LLM上下文,提升长程任务表现。
提出Prompt-Aware Online Evaluation Scheduling (POES),提升自动prompt优化效率和效果。
论文提出DDO-RM优化策略,在LLM偏好优化任务中优于DPO,但结果初步。
TTVS通过测试时变分合成,提升自探索强化学习在无监督环境下的性能。
该论文通过优化噪声调度和代理展开训练,提高了扩散模型在PDE模拟中的精度和效率。
提出MERS方法,结合监督和自监督嵌入进行回放缓存选择,提升持续学习性能。
提出了Plan-RewardBench,用于评估智能体环境中轨迹级奖励模型的性能,揭示现有模型在长序列规划中的不足。
提出Hierarchical Experience (HiExp)框架,提升LLM搜索Agent的训练效率和稳定性。
利用深度强化学习自动设计量子电路,优化VITE算法在NISQ设备上的表现。
论文从轨迹来源角度统一分析LLM后训练方法,提出支持扩展、策略重塑和行为巩固三个核心角色。
T-STAR通过认知树和手术策略优化,提升多步推理任务中Agent的策略学习能力。
MARS通过微调AR模型,使其一次预测多个token,提升生成速度和效率。
QNAS是一个量子神经网络架构搜索框架,旨在优化精度、效率和电路切割开销。
NestPipe通过嵌套流水线解决大规模推荐模型训练中的数据移动瓶颈,实现了高效且一致的训练。
NICO-TSP学习局部搜索过程,提升旅行商问题求解的效率和泛化性。
VertAX是一个基于JAX的可微分顶点模型框架,用于学习上皮组织力学。
MSPA-CQR通过多维度自洽偏好对齐进行对话搜索中的查询重写,提升检索和响应效果。
提出In-Place TTT,一种使LLM具备即时训练能力的框架,提升模型在实际任务中的适应性。
提出了基于广义贝叶斯推断的数据分布估值框架,适用于评估数据质量和增强数据。
JD-BP框架联合优化竞价与定价,提升广告收益和目标成本控制。
提出一种基于KL散度和Kahneman-Tversky优化的微调框架,用于控制LLM生成结果的分布偏差。
CuraLight利用RL辅助LLM进行交通信号控制,通过辩论式数据清洗提升性能。
论文提出AsymGRPO算法,通过解耦正负rollout熵调制,提升RLVR中LLM的探索能力,避免陷入局部最优。
提出SandMLE框架,通过生成小规模合成数据,加速MLE Agent的on-policy强化学习训练。
论文研究了基于DSPy的声明式学习在优化LLM提示工程方面的应用,提高了LLM的准确性和效率。
针对微调神经网络的完整性风险,提出细粒度完整性验证和证明方法,确保模型演进受控。
论文提出了一种名为“caution”的悲观强化学习方法,有效缓解了Best-of-N采样中常见的奖励黑客问题。
提出了一种针对Transformer模型中Softmax计算瓶颈的快速近似方法HCCS,优化了int8推理速度并保持精度。
SKILL0框架通过在训练时逐步移除技能上下文,实现LLM智能体技能的参数化内化,提升零样本自主能力。
提出了一个两阶段框架,用于预测异构HPC系统中GPU资源和功耗,以优化调度。
利用SHRED网络,从稀疏数据高精度重构核聚变堆液态金属包层中MHD流场的时空状态。
论文研究了离散随机动力学模型中基于梯度的参数推断方法。
该论文提出了ADIOS系统,利用GGGP优化基于Agent的传染病干预策略,旨在辅助决策者制定有效的非药物干预措施。
ProCeedRL通过过程批评和探索性演示强化学习提升LLM Agent在复杂任务中的推理能力。
提出World Action Verifier (WAV)框架,通过前向-逆向不对称性实现世界模型的自改进。
CliffSearch提出了一种基于LLM代理的科学算法发现框架,融合理论与代码,并强调正确性和原创性。
S0 Tuning通过优化循环层初始状态,在混合模型上实现零推理开销的性能提升。
论文提出OmniMem,一个基于自主研究的终身多模态记忆框架,显著提升AI agent在多模态任务上的表现。
VRF通过概率偏好分解和不确定性感知,提升LLM个性化效果。
提出了一种基于模型强化学习的自适应光学方法PO4NCPA,用于校正高对比度成像中的像差。
该论文提出了一种名为Dignified Peer的框架,旨在提升LLM的正直性和同伴性。
提出FP-DRL算法,结合Flow匹配和Distributional RL,解决传统RL多模态分布建模不足的问题。
提出PsychAgent,一个经验驱动的终身学习心理咨询Agent,通过持续学习提升咨询质量。
HERA通过进化多智能体RAG的编排和提示,提升复杂推理任务的性能。
提出 Meta-TTL 框架,通过元学习优化语言Agent的测试时学习适应策略,提升泛化能力。
提出OBD-LLM,利用二阶 Hessian 信息进行LLM的低秩分解,显著提升分解效果。
提出PG-IPRO算法,通过用户反馈迭代优化城市路线规划,适用于不同可达性需求。
提出RefineRL,通过自精炼和强化学习提升LLM在竞争性编程中的表现。
对比LoRA/QLoRA和偏好优化在心理健康文本分类任务中的效果,并提供优化策略选择建议。
本文对LLM的On-Policy Distillation方法进行了全面综述,填补了该领域缺乏统一处理的空白。
论文复现并扩展MONA,探索学习审批机制对奖励攻击的影响,发现校准过的学习审批可缓解奖励攻击但存在欠优化。
研究内容结构对生成式引擎优化效果的影响,提出GEO-SFE框架提升内容可见性。
ShapE-GRPO通过Shapley值分解集合奖励,提升多候选LLM训练效果,加速收敛。
提出Big2Small框架,通过隐式神经表示压缩模型,实现高效的模型压缩和推理。
提出血液中心捐献者招募优化框架,平衡供需,减少过度招募造成的捐献者疲劳。
MemFactory提供统一的记忆增强Agent训练和推理框架,简化Agent记忆管理优化。
AP-DRL通过异构计算和智能任务划分,加速深度强化学习训练,提升性能。
循环神经网络无需完整雅可比传播即可在线学习,仅用即时导数和梯度归一化即可。
FL-PBM通过预训练阶段的数据过滤,有效缓解联邦学习中的后门攻击。
研究自改进系统的安全性验证的信息论极限,探讨安全门的设计。
针对PISA测试,论文探索利用小规模保密数据集生成大规模训练数据的方法,以提升自动阅卷效果。
提出一种基于动态内存分配的联邦增量学习方法,解决医疗场景下数据非IID和灾难性遗忘问题。
Kernel-Smith提出了一种高性能GPU内核和算子生成的统一框架。
通过模型合并将语言知识迁移到指令微调LLM,无需特定语言指令和重复微调。
论文研究了将非神经网络的机器学习Pipeline迁移学习到神经网络,以实现统一推理。
论文提出了一个自提升LLM的统一框架,涵盖数据获取、选择、优化和推理等环节,并展望了未来研究方向。
论文分析了On-Policy Distillation的失效模式,并提出了改进方法以提升LLM的训练稳定性与性能。
提出Cross-Preference Learning框架,通过显式建模sentence-level和context-aware翻译的互补优势,提升机器翻译质量。
论文对比了手工prompt、基础DSPy和GEPA优化DSPy在语言任务中的表现,结果依赖于具体任务。
利用大语言模型作为优化控制器,实现自适应的SIMP拓扑优化。
UI-Voyager提出了一种自进化的移动GUI代理,通过RFT和GRSD提高学习效率。
AVO提出了一种基于自主智能体的进化搜索变异算子,超越传统方法。
针对锂电池SOH预测,提出结合领域自适应和不确定性量化的迁移学习框架,提高预测的泛化性和可信度。
研究了联邦学习中客户端语言构成对多语言LLM性能、公平性和效率的影响。
DVM提出一种基于字节码虚拟机的实时编译器,加速动态AI模型的编译和执行效率。
提出TsetlinWiSARD,一种基于Tsetlin Automata的Weightless神经网络片上训练方法,提升硬件效率和精度。
提出了一种基于强化学习的动态课程学习方法,提升Deepfake检测的鲁棒性和泛化性。
提出了一种融合数值数据和人类偏好的多模态贝叶斯优化框架,用于高效控制器学习。
论文提出了一种混合信号神经形态处理器上的反馈控制优化器,用于片上学习,并在实际任务中验证了其可行性。
提出了一种两阶段微调方法,使小型模型在Text-to-SQL任务上实现高精度和低延迟。
ELITE通过经验学习和意图感知的迁移,提升具身智能体在复杂任务中的表现。
针对数据稀缺和任务重叠的持续学习问题,提出基于相似性感知的混合专家模型。
提出Bilevel Autoresearch框架,通过元优化内循环的搜索机制,显著提升了LLM的预训练效果。
SortedRL通过在线长度感知调度加速LLM的RL训练,提高rollout效率并保持训练稳定性。
提出ReVal,一种基于价值的强化学习方法,提高LLM训练效率并在数学推理任务上超越GRPO。
该论文通过引入稀疏性和优化CUDA内核,提升了Transformer语言模型的推理和训练效率。
利用薛定谔本征函数求解高维随机最优控制问题,显著提升长时域控制精度。
Polaris通过经验抽象进行策略修复,提升小语言模型的递归自改进能力。
Weak-PDE-Net提出了一种可微框架,用于从稀疏和噪声数据中发现偏微分方程。
MIDST挑战赛评估扩散模型生成合成表格数据在抵抗成员推断攻击方面的隐私性。
SOL-ExecBench提出了基于硬件极限的GPU Kernel性能评估基准。
论文评估了基于5W3H结构的prompt方法PPS,以提升人机交互中意图对齐的效果,尤其在高歧义任务中。
研究了带单指标模型的上下文Bandit问题,提出了兼顾学习和推理的核化算法。
RewardFlow通过状态图拓扑感知奖励传播,提升LLM Agent在稀疏奖励环境下的推理能力。
ProRL Agent提出了一种基于Rollout-as-a-Service的LLM Agent RL训练框架,提升了可扩展性和易维护性。
Memento-Skills构建了一个通过经验自主设计和改进agent的通用可持续学习LLM agent系统。
研究了持续学习在自然语言处理意图分类中的灾难性遗忘问题,并比较了多种缓解策略。
LSE框架训练LLM在测试时通过强化学习改进上下文,提升性能。
针对EWC在持续学习中的不足,提出Logits Reversal方法,显著提升性能。
AgentFactory提出了一种基于可执行子代理的自进化框架,通过积累和复用子代理代码实现能力增长。
RHYME-XT是一种用于时空控制系统代理建模的神经算子框架。
DiscoGen提出了一种算法发现任务的程序化生成方法,用于优化机器学习算法。
RangeAD通过利用主模型的神经元输出范围进行异常检测,实现了高性能和低推理成本。
提出一种两阶段后训练流程,用于提升小型本地LLM在Linux提权任务中的性能,接近大型模型。
提出Complementary RL,通过经验提取器与策略执行器协同进化,提升强化学习的样本效率。
QuantFL通过预训练模型量化,降低边缘IoT联邦学习的通信能耗,实现可持续学习。
LEAFE框架通过反思经验学习反馈驱动的代理能力,提升LLM在复杂交互任务中的问题解决能力。
随机重置能有效加速强化学习策略收敛,尤其在探索困难和奖励稀疏的环境中。
论文提出了一种基于强化学习和逆向规范奖励的自动幻灯片生成方法。
该论文研究了大型语言模型中的文化偏见问题,并提出利用DSPy进行提示编程以优化文化对齐。
提出了一种保守的连续时间治疗优化框架,通过MMD正则化限制外推。
提出轨迹优化时间重参数化方法(TOTR),提升机器学习降阶模型在刚性系统中的学习性能。
论文研究了使用合成数据集定制小型LLM用于特定领域代码生成的三种方法,并分析了它们的优劣。
PlotTwist利用结构化框架和偏好对齐,使小型语言模型能生成高质量的故事梗概。
提出物理信息神经网络和神经算子用于EUV光刻掩模衍射的快速精确模拟。
论文提出了一种基于进化迁移学习的Dragonchess AI,通过进化优化改进了Stockfish的启发式评估函数。
PrototypeNAS提出一种零样本NAS方法,加速微控制器上DNN设计,优化模型结构与量化。
综述低成本、低功耗边缘AI和TinyML在资源受限农业系统中的部署现状与挑战。
提出MRPO算法,利用自动构建的细粒度标准和记忆增强实现LLM创造性写作的迭代优化。
MONET建模神经网络训练过程,优化异构数据流加速器上的训练效率。
HiAP提出了一种多粒度随机自动剪枝框架,用于优化Vision Transformer的效率。
HATS提出一种硬度感知轨迹合成框架,提升GUI智能体在语义模糊场景下的泛化能力。
利用LLM在单GPU上进行资源高效的迭代式神经架构搜索。
研究强化学习微调对LLM Agent在不同环境下的泛化性能,并分析影响因素。
CHiL(L)Grader框架结合置信度估计和人机协作,实现可靠的AI辅助短答案评分。
FlexRec利用强化学习微调LLM,解决推荐系统中动态需求下的排序问题,显著提升推荐效果。
提出了一种反向神经算子INO,用于从稀疏观测数据中恢复ODE参数。
简单微调方法结合低秩适应LoRA,在大规模VLA模型的持续强化学习中表现出色。
论文探讨了非遍历性奖励过程对强化学习的影响,并讨论了优化个体轨迹长期性能的现有解决方案。
提出V0.5算法,通过融合通用价值模型先验和稀疏采样经验均值,构建鲁棒的advantage baseline。
PRISM-$Δ$通过差异子空间指导Prompt高亮,提升LLM生成质量并降低成本。
提出一种轨迹信息驱动的记忆生成框架,提升Agent在复杂任务中的表现。
HAPEns是一种硬件感知的后验集成方法,旨在平衡表格数据的预测性能和硬件效率。
提出了一种基于自微调的无奖励智能体框架,用于实现自适应RAN切片控制。
论文提出GR$^3$方法,有效缓解强化学习中的长度膨胀问题,同时保持性能。
VERI-DPO通过声明验证和直接偏好优化提升临床摘要的真实性。
PEEM提出一种可解释的提示词和响应联合评估框架,用于指导LLM交互优化。
提出一种基于LSTM和QCBM的混合量子-经典金融波动率预测框架,显著提升预测精度。
RbtAct提出了一种利用同行评议回复优化LLM生成可操作性反馈的方法,提高AI生成评审的质量。
ESAinsTOD提出了一种统一的schema-aware指令调优框架,提升了面向任务对话建模的泛化能力。
SparseLoom通过模型缝合技术优化边缘设备上多DNN推理系统,提升效率。
PRECEPT框架通过经验、上下文工程和轨迹探索,提升LLM在测试时的适应性和鲁棒性。
EDA通过参数高效适配和数据再生策略,提升精调LLM的推测解码性能,降低训练成本。
TrainDeeploy框架加速Transformer模型在边缘设备上的参数高效微调。
ACT通过强化学习训练LLM智能体判断最优行动,提升智能体推理能力和泛化性能。
该论文提出PostTrainBench,评估LLM Agent自主完成LLM后训练的能力,并发现了潜在风险。
RetroAgent通过双重内在反馈和经验检索,提升LLM Agent在复杂环境中的持续进化能力。
提出PolarBear框架,通过贝叶斯竞争方法,在未知计算预算下选择Pareto最优的随时算法。
提出了一种混合评估遗传编程算法,用于解决不确定性敏捷地球观测卫星调度问题。
提出GRACE框架,自适应调整模型容量,平衡可塑性和稳定性,提升增量学习效率。
人类和AI反馈中存在“选择盲视”现象,导致RLHF训练信号被扭曲,标准评估指标难以检测。
提出基于分数阶微积分的优化算法,解决不平衡数据中的过拟合问题。
PolyFormer利用几何结构将复杂约束转化为高效多面体,实现可扩展的物理约束优化。
提出Fibration Policy Optimization(FiberPO),一个统一LLM策略优化的多尺度稳定控制框架。
AutoAdapt是一个自动化的LLM领域自适应框架,提升模型在特定领域的能力。
RoboPocket利用手机AR进行机器人策略迭代,提升数据效率并加速在线精调。
论文分析了辩论在可扩展监督高级AI系统中的价值,并用知识差异的几何结构来量化辩论优势。
Stable-LoRA通过动态权重衰减优化LoRA,解决其特征学习不稳定的问题,提升模型性能。
提出了一种可训练的逐位软量化层,用于压缩神经网络的输入特征,以适应物联网设备的资源限制。
提出奖励条件强化学习RCRL,通过条件策略学习多个奖励目标,提升鲁棒性和适应性。
提出了一种基于Margin Cross-Entropy Loss(MCEL)的容错量化神经网络训练方法,无需错误注入。
HiFlow通过层级反馈优化框架,提升LLM在约束条件下生成长文本的能力,实现全局结构和局部语义的协同。
论文发现,在微调阶段重放预训练数据可显著提高目标任务的性能和数据效率。
EvoTool通过进化策略优化LLM智能体的模块化工具使用策略,提升复杂任务解决能力。
SEA-TS通过自进化循环自主生成、验证和优化时间序列预测代码,性能超越现有方法。
论文提出AAJR方法,通过对抗对齐的雅可比正则化提升Agentic AI系统的鲁棒性和稳定性。
提出了Meta-Adaptive UKF(MA-UKF),利用元学习优化UKF的sigma点权重,提高鲁棒性和泛化性。
论文提出开放向量Prompt接口以提升LLM定制能力,优于文本Prompt,并讨论了安全性和应用前景。
InstMeter通过MCU时钟周期预测DL模型在MCU上的能耗和延迟,精度高且所需数据量少。
提出一种基于世界模型反馈的在线持续强化学习框架,实现机器人自主适应。
LoRA-MME利用LoRA微调多个代码编码器,集成模型进行代码注释分类,提升性能但牺牲了效率。
GIPO提出一种基于重要性采样的策略优化方法,提升强化学习的样本效率和稳定性。
提出一种面向多工作负载的片上内存计算加速器联合软硬件协同优化框架,显著提升通用性。
提出一种基于规则的监督框架,从稀疏真实数据中学习代码代理的评价模型,提升代码生成任务性能。
提出了一种基于条件变分自编码器(CVAE)的SRS反演方法,高效重建冲击时间序列。
研究对比引导在LLM中对数据集污染的鲁棒性,并提出缓解恶意污染的方法。
MOSAIC框架通过显式安全决策,提升Agent在多步工具使用中的安全性,降低有害行为。
UniSkill提出了一个大学课程与职业技能匹配的数据集,并用BERT模型进行了基线测试。
RAPO通过检索增强策略优化,扩展LLM Agent的探索空间,提升agent在复杂任务中的表现。
PrivMedChat提出了一种差分隐私医疗对话系统的端到端RLHF框架。
论文提出了潜在价值假设,解释了RLAIF通过自反馈进行价值学习的有效性,并提出了线性模型进行分析。
提出了一种基于上下文感知的隐私保护框架CDI,通过强化学习优化指导模型,提升LLM Agent的隐私安全。
CGL框架通过SFT和RL的协同,提升GUI Agent在持续学习中的适应性和技能保持能力。
提出BehaveSim,通过分析程序执行轨迹来评估算法相似性,提升LLM自动算法设计效果。
提出了一种运行时可重构的多精度位级脉动阵列架构,用于加速量化神经网络。
EMPO$^2$通过混合策略优化和记忆增强,提升LLM Agent在探索性任务中的性能和泛化能力。
提出一种无监督持续学习框架,用于提升摊销贝叶斯推理在序列数据上的性能。
HGPO通过层级分组优化解决长时程Agent任务中上下文不一致导致的优势估计偏差问题。
提出基于模拟优化的增强阅读方法,利用资源理性模型改善文本呈现和理解。
提出GR4AD,一个面向大规模广告的生成式推荐系统,优化模型和推理效率。
GUI-Libra提出了一种针对GUI智能体的训练方法,优化了数据、SFT和RL过程,显著提升了任务完成度。
论文提出了一种网格尺寸不变的代理模型,用于预测多孔介质中的流体流动。
SWE-Protégé框架提升了小语言模型在软件工程任务上的性能,通过模仿专家协作。
提出了一种新的函数空间经验贝叶斯正则化框架,使用Student's t先验提高不确定性估计的鲁棒性。
Excitation提出了一种新的优化框架,通过动态调整专家利用率加速MoE模型的学习。
论文提出了一种评估和反馈咨询师处理来访者阻抗反应的多维度方法。
SC-VLA通过稀疏世界想象实现在线动作优化,提升VLA模型在机器人操作任务中的性能。
SELAUR提出了一种基于不确定性感知的奖励机制,提升LLM Agent的探索效率和学习稳定性。
提出Semantic-guided Adaptive Expert Forest (SAEF)方法,解决增量学习中的知识遗忘和知识共享问题。
AdaEvolve通过层级自适应优化,提升了LLM驱动的进化搜索效率,解决了资源分配不均的问题。
Hexagon-MLIR:一个面向高通NPU的开源AI编译栈,统一支持Triton和PyTorch模型。
该论文分析了算法展开中导数迭代发散的“诅咒”现象,并提出了缓解方案。
针对LLM异步RL训练中梯度方差过高问题,提出方差控制策略优化VCPO算法。
该论文提出EWC-LoRA方法,通过正则化低秩更新缓解参数高效持续学习中的任务干扰。
提出一种模块化生成模型框架,通过组合领域专家模型提升性能和鲁棒性,并提供理论证明和算法。
KLong通过轨迹分割SFT和渐进式RL训练,提升LLM Agent的超长时程任务解决能力。
该论文提出了一种自适应正则化框架,用于在微调过程中防止语言模型的安全性下降。
提出了一种自适应去中心化复合优化方法,利用三算子分裂和BCV预处理实现高效优化。
针对嵌入式系统,研究ARM Cortex处理器上AI模型的能效优化,提出了Pareto最优基准测试框架。
ILRec提出了一种新的LLM推荐框架,利用中间层的自生成困难负样本提升推荐性能。
提出SIGOOD,利用提示驱动的自提升优化实现图OOD检测。
提出了基于课程学习的持续不确定性学习框架,用于解决复杂非线性系统的鲁棒控制问题。
提出ZO-Muon方法,通过子空间梯度正交化,显著提升零阶优化在微调大型模型时的效率和精度。
Bonsai框架提出了一种基于准则的CNN剪枝方法,旨在加速和压缩模型。
论文研究了强化学习在参数化量子态制备中的应用,比较了不同策略和算法的性能。
提出了LoRSum方法,通过近端子空间迭代,在避免SVD的情况下高效微调LoRA模型。
研究不同数值表示对嵌入式深度学习模型抗电磁故障注入攻击能力的影响。
PERSONA框架通过激活向量代数实现LLM动态且可组合的个性化控制,无需微调。
提出一种基于扩散模型的逆向材料设计方法,可生成多样且高性能的材料。
Uni-Flow模型结合自回归和扩散模型,高效模拟复杂多尺度流体动力学。
提出一种两级框架,在设计后验证用户指定属性,无需额外测试数据。
GaiaFlow通过语义引导扩散调优实现碳节约型搜索,兼顾精度与环境效益。
提出了一种解耦对齐学习和策略优化的无交互逆强化学习框架,构建可检验的奖励模型。
D2-LoRA是一种参数高效的微调方法,在保证性能的同时,实现了代数可合并性和低推理延迟。
提出一种基于随机无偏近似向量-雅可比积的反向传播方法,以降低深度学习的计算和内存成本。
提出E-SPL方法,结合强化学习和进化系统提示学习,提升LLM在推理和Agent任务中的性能和泛化能力。
提出基于核方法的量子储备计算机测量算子优化方案,提高预测精度和效率。
提出On-Policy上下文蒸馏(OPCD),通过在生成轨迹上训练学生模型来提取和整合上下文知识。
CM2提出使用checklist奖励的强化学习框架,优化多轮多步骤的智能体工具使用。
提出T3D框架,通过轨迹自蒸馏和DDO优化,提升扩散语言模型少步解码的生成质量和效率。
提出了SAGEO Arena,一个用于评估搜索增强生成引擎优化(SAGEO)的真实环境。
该论文理论分析了采样方法对LLM对齐的影响,揭示了采样偏差可能导致的对齐问题。
GRXForm通过组相对策略优化方法,提升了分子优化模型在未见结构上的泛化能力。
提出Value Alignment Tax (VAT)框架,用于衡量对齐诱导的价值权衡和连锁反应。
提出了广义On-Policy蒸馏框架G-OPD,并通过奖励外推ExOPD和奖励校正改进学生模型性能。
P-GenRM通过生成式奖励模型和用户原型聚类,提升个性化语言模型的奖励信号准确性和泛化能力。
Iskra系统可高效地对几何处理算法进行微分,实现反向几何处理。
提出Composition-RL方法,通过组合prompt优化LLM的强化学习训练,提升推理能力。
研究差分隐私对基于脉冲神经网络的联邦学习中神经元放电率的影响。
论文分析了非平稳环境下动量最小均方算法(MLMS)的稳定性和跟踪性能,并给出了理论界限。
本文通过神经架构搜索优化GPT-OSS模型推理,降低成本并提升效率。
AdaptEvolve通过置信度驱动的LLM选择,在进化智能体中实现了计算效率和性能的平衡。
AlphaPROBE通过图结构建模,提升alpha因子挖掘的效率、稳定性和准确性。
针对DPO在悲观样本上的“过早满足”问题,提出了Hybrid-DPO(HyPO),通过有条件地去偏参考信号来提升对齐效果。
提出了约束初始表示的强化学习框架CIR,通过Tanh激活等方式稳定训练,提升样本效率。
提出了MaxExp和SSE两种方法,用于优化多物种存在-缺席模型的二值化预测。
提出一种基于LoRA的参数高效联邦学习框架,用于边缘设备上的恶意软件持续检测。
LoRA-Squeeze通过后处理和训练时压缩LoRA模块来提升性能,简化部署。
TVCACHE通过状态感知的缓存技术加速LLM智能体的工具调用,显著提升训练效率。
提出一种联合自提升的分子优化方法,解决生成模型中的分布偏移和样本效率问题。
研究了RNN训练中burn-in阶段对性能的影响,并通过实验验证其重要性。
提出一种基于低秩适配的神经接收机LOREN,降低了多码率支持的硬件开销。
UMEM联合优化LLM的记忆提取与管理,通过语义邻域建模提高记忆泛化能力,在交互任务中表现出色。
CoFEH提出了一种基于LLM的特征工程框架,通过协同贝叶斯优化实现端到端AutoML。
通过动态梯度裁剪实现强化学习中LLM策略熵的精确控制,有效缓解熵坍塌问题。
提出SOFT-FLOW框架,利用正态化流和分块评论家,实现高效灵巧操作策略的现实微调。
论文提出Autoregressive DPO (ADPO),一种将自回归建模显式集成到偏好优化框架的新方法。
提出自适应神经连接重分配(ANCRe)框架,优化残差连接,提升深度网络的效率。
提出Spatio-Temporal Pruning(STP)框架,提升基于扩散模型的LLM的强化学习效率和稳定性。
提出基于偏好的多目标强化学习方法,用于学习社会群体的价值体系。
提出Variational In-Context Reward Modeling (ICRM),提升奖励模型测试时可控性和泛化能力。
综述了生物识别中高效深度学习方法,讨论了训练和部署挑战,提出了评估指标和未来研究方向。
提出了OSCAR框架,通过优化指导的Agent规划实现组合图像检索,显著提升检索性能。
Share提出一种共享LoRA子空间的方法,用于解决严格持续学习中的灾难性遗忘问题。
论文研究了 Thompson Sampling 在多臂赌博机问题中的稳定性,并提出了通过乐观机制实现稳定性的方法。
Diamond Maps通过随机流图实现高效的奖励对齐,提升生成模型适应性。
提出了一种基于LSTM和随机森林的混合数据驱动算法,用于液压缸的实时摩擦力估计。
论文提出基于f散度的通用LLM对齐算法,在可验证奖励的强化学习和偏好对齐任务上表现出色。
论文分析了一种改进的策略镜像下降算法PMD-mean,并揭示了其对LLM后训练的隐式正则化作用。
DFPO通过学习值流建模,提升LLM在噪声环境下的鲁棒性和泛化能力。
提出了Constrained GRPO,一种基于拉格朗日的、带有约束的策略优化方法,并解决了优势估计中的问题。
DARWIN利用遗传算法优化GPT模型,实现自改进,提升模型性能。
Bifrost通过引导轨迹调整,弥合上下文差距,提升自提升智能体的性能。
提出RL-VLA$^3$框架,通过全异步策略加速VLA模型的强化学习训练,提升训练效率。
研究AI自动优化方法在Rocq定理证明Agent中的应用,评估其优化Agent策略的能力。
TimelyFreeze自适应参数冻结,优化流水线并行训练,提升吞吐量并保持精度。
LeakBoost通过感知损失主动探测模型,增强成员推理攻击的效果。
OmniMoE通过原子专家和系统算法协同设计,实现了高效细粒度MoE,显著提升了推理速度和准确性。
提出了一种基于非平衡最优传输的语法纠错评估指标UOT-ERRANT,提高了评估性能和可解释性。