OLMo232B–Ai2推出的最新开源语言模型
AI工具百科:
OLMo 2 32B是什么
OLMo 2 32B 是 Allen Institute for AI(Ai2)推出的最新开源语言模型,是 OLMo 2 系列的重要成果。拥有 320 亿参数,是首个在多技能学术基准测试中超...
SketchVideo–快手联合多所高校推出基于草图的视频生成与编辑框架
AI工具百科:
SketchVideo是什么
SketchVideo 是中国科学院大学,香港科技大学和快手可灵团队推出的基于草图的视频生成与编辑框架。在关键帧上绘制草图,结合文本提示,实现对视频的空...
ChildMandarin–智源联合南开开源的低幼儿童中文语音数据集
AI工具百科:
ChildMandarin是什么
ChildMandarin 是智源研究院联合南开大学计算机学院人类语言技术实验室(HLT Lab)共同推出的,针对35岁儿童的普通话语音数据集。数据集包含41.25小...
MiniMaxMCPServer–MiniMax推出基于MCP的多模态生成服务器
AI工具百科:
MiniMax MCP Server是什么
MiniMax MCP Server 是 MiniMax 稀宇科技推出的基于模型上下文协议(MCP)的多模态生成服务器。通过简单的文本输入,可调用视频生成、图像生成...
SpatialLM–群核科技开源的空间理解多模态模型
AI工具百科:
SpatialLM是什么
SpatialLM 是群核科技开源的空间理解多模态模型,赋予机器人和智能系统类似人类的空间认知能力。通过分析普通手机拍摄的视频,能重建出详细的 3D 场景布局...
VITAAudio–开源的端到端多模态语音大模型,低延迟、推理快
AI工具百科:
VITAAudio是什么
VITAAudio 是开源的端到端多模态语音大模型,具有低延迟、推理速度快的特点。通过轻量级的多模态交叉标记预测(MCTP)模块,可在首次前向传播中生成音频...
3DTown–哥伦比亚联合CybeverAI等推出单视图生成3D城镇场景的框架
AI工具百科:
3DTown是什么
3DTown 是哥伦比亚大学联合Cybever AI等机构推出的从单张俯视图生成3D城镇场景框架。框架基于区域化生成和空间感知的3D修复技术,将输入图像分解为重叠区域...
AutoBE–AI驱动的后端服务器代码生成工具
Ai工具百科:
AutoBE是什么
AutoBE 是 AI 驱动的后端服务器代码生成工具,通过用户描述需求自动生成高质量的后端代码。基于 TypeScript、NestJS、Prisma 和 Postgres 等技术栈构建,强...
ObjectMover–港大联合Adobe推出的新型图像编辑模型
AI工具百科:
ObjectMover是什么
ObjectMover 是香港大学和 Adobe Research 联合提出的新型图像编辑模型,解决图像中物体移动、插入和移除时出现的光照、阴影不协调以及物体失真等问题...
FaceShot–同济大学联合上海AILab等推出的肖像动画生成框架
AI工具百科:
FaceShot是什么
FaceShot是同济大学、上海 AI Lab和南京理工大学推出的新型无需训练的肖像动画生成框架。用外观引导的地标匹配模块和基于坐标的地标重定位模块,为各种角...
Devstral–MistralAI联合AllHandsAI开源的编程专用AI模型
Ai工具百科:
Devstral是什么
Devstral是Mistral AI和All Hands AI推出的专为软件工程任务设计的编程专用模型。Devstral在解决真实世界软件问题上表现出色,在SWEBench Verified基准测...
FramePack–斯坦福开源的AI视频生成模型
AI工具百科:
FramePack是什么
FramePack 是斯坦福大学开源的AI视频生成模型。基于压缩输入帧的上下文长度,解决视频生成中的“遗忘”和“漂移”问题,让模型能高效处理大量帧,保持较低的...

