Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

BeyondWeb:在万亿规模预训练中规模化合成数据的启示

PaperRegister:通过分层注册索引提升细粒度论文检索






























DINOv3
SSRL:自搜索强化学习
Thyme:超越图像的思考
用文化知识对多语言多模态LLM进行接地
HiFiTTS-2:一个大规模高带宽语音数据集
CryptoScope:利用大语言模型实现密码逻辑漏洞的自动化检测
医学图谱RAG:通过图谱检索增强生成实现安全的医学大语言模型
Puppeteer:为你的3D模型绑定并动画化
STream3R:基于因果Transformer的可扩展序列3D重建
PRELUDE:一个旨在要求对长上下文进行全局理解与推理的基准
ToonComposer:通过生成式后关键帧技术简化动画制作
NextStep-1:面向大规模连续Token的自回归图像生成
We-Math 2.0:一种用于激励视觉数学推理的多功能MathBook系统
COREVQA:一种众包观察与推理蕴含的视觉问答基准
RelayFormer:一种用于可扩展图像与视频操纵定位的统一局部-全局注意力框架
GMF-Drive:具有空间感知BEV表示的门控Mamba融合用于端到端自动驾驶
看、听、记、思:具备长期记忆的多模态Agent
扩散型LLM可通过离散扩散强制实现快于自回归的推理
AWorld:具有稳定机动性的动态多Agent系统,用于鲁棒的GAIA问题求解
Story2Board:一种无需训练的富有表现力的分镜生成方法
替身:一种轻量级且即插即用的视频生成身份控制方法
Mol-R1:面向分子发现中显式长链思维推理
Llama-Nemotron:高效推理模型
Document Haystack:一个长上下文多模态图像/文档理解视觉LLM基准
Echo-4o:利用GPT-4o合成图像提升图像生成性能
无标记组织在成像质谱中的虚拟染色
VisCodex:通过融合视觉与编码模型实现统一的多模态代码生成
HierSearch:一种集成本地搜索与网络搜索的分层企业深度搜索框架
时间是一种特征:在扩散语言模型中利用时间动态特性
CharacterShot:可控且一致的4D角色动画