OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning
OGER通过离线指导和在线探索相结合,提升LLM在推理任务上的性能和泛化能力。
Daily arXiv paper tracking with AI-powered analysis
OGER通过离线指导和在线探索相结合,提升LLM在推理任务上的性能和泛化能力。
该论文探索了Qwen模型在遥感图像变化视觉问答(Change VQA)任务中的应用,并对比了不同模型架构。
研究表明,语言模型激活中包含比推理链token更多的重要步骤信息,模型内部编码步骤重要性。
该论文提出了一种利用视觉指令调整的视觉-语言框架,通过理解医学图像来提高生存预测的准确性。
AQPIM通过PIM内激活量化,突破LLM容量瓶颈,提高带宽和计算效率。
ContraPrompt通过对比推理轨迹优化Prompt,显著提升LLM在复杂任务上的性能。
LeapAlign通过两步轨迹优化Flow Matching模型,降低计算成本并提升早期生成步骤的更新效果。
MM-WebAgent是一个用于多模态网页生成的分层代理框架,通过规划和自反思协调AIGC工具。
RAD-2提出了一种生成器-判别器框架,用于提升自动驾驶规划的稳定性和安全性。
该论文研究了LLM在最短路径问题中的泛化能力,发现空间迁移能力强,但长度缩放泛化失败。
OGER通过离线指导和在线探索相结合,提升LLM在推理任务上的性能和泛化能力。
该论文探索了Qwen模型在遥感图像变化视觉问答(Change VQA)任务中的应用,并对比了不同模型架构。
研究表明,语言模型激活中包含比推理链token更多的重要步骤信息,模型内部编码步骤重要性。
该论文提出了一种利用视觉指令调整的视觉-语言框架,通过理解医学图像来提高生存预测的准确性。
AQPIM通过PIM内激活量化,突破LLM容量瓶颈,提高带宽和计算效率。
ContraPrompt通过对比推理轨迹优化Prompt,显著提升LLM在复杂任务上的性能。
LeapAlign通过两步轨迹优化Flow Matching模型,降低计算成本并提升早期生成步骤的更新效果。
MM-WebAgent是一个用于多模态网页生成的分层代理框架,通过规划和自反思协调AIGC工具。
RAD-2提出了一种生成器-判别器框架,用于提升自动驾驶规划的稳定性和安全性。
该论文研究了LLM在最短路径问题中的泛化能力,发现空间迁移能力强,但长度缩放泛化失败。
研究了LLM和VLM在无视觉输入下对视角旋转的理解能力,并进行了可解释性分析。
论文评估了视觉异常检测在自动驾驶安全中的应用,并提出了高效的边缘部署模型。
分析了VLM在识别人类情感方面的不足,并提出了针对长尾分布和时间信息缺失的解决方案。
Prism提出了一种基于符号表示的张量程序超级优化方法,显著提升了性能。
SegWithU提出了一种高效的单次前向传播医学图像分割不确定性估计方法。
该论文提出一种基于Agentic Microphysics和Generative Safety的生成式AI安全研究方法。
Blue提出DIL,通过智能体编排和数据整合,实现多源多模态数据驱动的应用,超越传统NL2SQL。
RadAgent通过工具使用和可解释的步骤,提升胸部CT报告的生成质量,并增强临床可信度。
研究发现LLM Judge易受上下文影响,存在对模型评估结果作弊的风险。
评估AI辅助需求工程工具与专家判断的差异,验证AI作为决策支持工具的潜力。