Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

N0-VTLA:利用隐式触觉令牌扩展视觉–触觉–语言–动作模型

从 RLVR 到 RLSVR:任务转换诱导自验证奖励,实现开放式大语言模型自我提升






























BEACON:洞悉何时以及如何进行智能体视觉推理
SkillSmith:学习组合参数化技能与文本知识
VideoCoCo:基于可执行代码思维链的智能体双引擎物理一致性视频生成系统
PHIZERO:围绕物理语言构建的世界模型
Frontis-MA1:面向机器学习工程中递归自我改进的 AI4AI 模型训练
Metis:记忆基础模型
Qwen-UI-Agent 技术报告:迈向下一代以真实世界为核心的基础 GUI 智能体
AskChem:面向化学文献综合的声明中心化基础设施
何为 Harness:智能体 Harness 的必要与充分条件
OPENFORGE RL:在任意环境中训练原生执行框架智能体
边推理边推测:通过联合智能体–推测器强化学习教会智能体预测下一次工具调用
Pangram 4 技术报告
AI 智能体能否开展开放式 AI 研究?来自两项案例研究的早期证据
代码即智能体骨架:迈向可执行、可验证且有状态的智能体系统
CAST:以游戏求解器作为回合级教师指导 LLM 智能体
CLBench-V:从上下文锚定到知识获取的多模态上下文学习评测
DecoEvo:文本空间中求解器与评分标准生成器技能的解耦评分协同进化
HumanCLAW:视觉语言模型能否通过身体行动?
CoRT:面向令牌级评分准则引导策略优化的反事实重放方法
TurboVLA:在 RTX 4090 上以 32 Hz 实时运行且显存占用低于 1 GB 的视觉-语言-动作模型
面向快速图像与视频生成的并行解码蒸馏
确定和集与差集之间的最优指数关系
基于错误定位的测试时扩展方法
NVIDIA-labs OO Agents:原生 Python 面向对象智能体
PerceptionBench:评估多模态大语言模型的原子视觉感知能力
物理增强神经常微分方程中的时间范围选择:理论洞见与磁链应用
面向视频对象插入与图层分解的显式图层建模
Transformer Transformer:面向运动条件机器人协同设计的统一模型
基于目标感知数据对齐的细粒度食物图像理解
证明器与求解器的验证