Command Palette
Search for a command to run...
论文
每日更新的前沿人工智能研究论文,帮助您紧跟最新的人工智能趋势
篇论文

基于神经增强的双尺度单图像去雾

SpeechPrompt:通过提示语音语言模型处理语音任务






























Music SketchNet:通过音高与节奏的分解表示实现可控音乐生成
自适应数据飞轮:将MAPE控制循环应用于AI代理改进
扩展VSR基准以适配VLLM,专精于空间规则
DensityTool:一种用于从VASP获取空间与自旋分辨态密度的后处理工具
一颗一维能量平衡模型参数化方案:用于描述偏心系外行星表面二氧化碳冰的形成
迈向终极大脑:利用ChatGPT AI探索科学发现
大语言模型中的医学推理:对DeepSeek R1的深入分析
Speech-FT:合并预训练与微调语音表示模型以实现跨任务泛化
DeepSeek LLM:以长期主义扩展开源语言模型
MatterGen:一种用于无机材料设计的生成模型
MultiActor-Audiobook:使用多位说话人的面部和声音进行零样本有声书生成
Phi-4 技术报告
LAMMPS模拟软件包的一套教程
GLM-4-Voice:迈向智能且拟人的端到端语音聊天机器人
面向视频配音的长度感知语音翻译
DrawingSpinUp:从单个角色绘图中生成3D动画
面向语音识别错误分析的音素导向词错误对齐(用于机器翻译)
ReaderLM-v2:面向 HTML 转 Markdown 和 JSON 的小型语言模型
面向故障运行汽车平台的部署计算与分析
MegActor:利用原始视频的强大力量实现生动的肖像动画
Flash-VStream:基于记忆的长视频流实时理解
PhotoMaker:通过堆叠ID嵌入定制逼真人物照片
StoryDiffusion:用于长程图像和视频生成的一致性自注意力
基于质量估计与纠正反馈的切罗基语-英语机器翻译演示系统
具有非弹性需求和视在功率约束的需求响应在线算法
ESPnet-SDS:面向语音对话系统的统一工具包与演示平台
Jais和Jais-chat:以阿拉伯语为中心的基础指令微调开放生成大型语言模型
用于无监督机器翻译的快速回译
面向基于电子健康记录(EHR)临床研究的开放自然语言处理(NLP)框架:基于国家COVID队列协作(N3C)的案例演示
基于扩散模型的音频修复