Qwen2.5Omni–阿里开源的端到端多模态模型
AI工具百科:
Qwen2.5Omni是什么
Qwen2.5Omni 是阿里开源的 Qwen 系列旗舰级多模态模型,拥有7B参数,Qwen2.5Omni具备强大的多模态感知能力,能处理文本、图像、音频和视频输入,支持...
RightNowAI–自动分析和优化CUDA内核代码的AI平台
Ai工具百科:
RightNow AI是什么
RightNow AI 是专注于优化 CUDA 代码的 AI 平台。通过自动分析和优化 CUDA 内核代码,显著提升 GPU 性能,支持多种 NVIDIA GPU 架构,如 Ampere、Hopp...
Ezra–AI广告创意生成平台,快速生成多种广告变体
AI工具百科:
Ezra是什么
Ezra 是AI驱动的广告创意生成平台,通过先进的AI技术帮助企业和营销人员快速创建高质量的广告内容。能根据用户提供的概念和目标,快速生成多种广告变体,支持...
Amie–AI会议工具,快速生成会议总结和行动项
AI工具百科:
Amie是什么
Amie是AI会议记录工具,帮助用户高效管理会议内容和后续工作。通过自动录音和生成会议总结,让用户在短时间内分享会议要点、更新CRM、计划行动项以及安排下次...
NEXUSO–多模态AI模型,实现对语言、音频和视觉全方位感知与交互
AI工具百科:
NEXUSO是什么
NEXUSO 是HiThink 研究院、英国帝国理工学院、浙江大学、复旦大学、微软、Meta AI等机构推出的多模态AI模型,能实现对语言、音频和视觉信息的全方位感知与...
SeniorTalk–智源联合南开开源的超高龄老年人中文对话语音数据集
AI工具百科:
SeniorTalk是什么
SeniorTalk 是智源研究院联合南开大学计算机学院人类语言技术实验室(HLT Lab)推出的全球首个中文超高龄老年人对话语音数据集。数据集包含202位75岁及...
XDancer–字节等机构推出音乐驱动的人像舞蹈视频生成框架
AI工具百科:
XDancer是什么
XDancer 是字节跳动联合加州大学圣地亚哥分校和南加州大学的研究人员共同推出的音乐驱动的人像舞蹈视频生成框架,支持从单张静态图像生成多样化且逼真的全...
MultiAgentOrchestrator–亚马逊开源的多智能体框架
AI工具百科:
MultiAgent Orchestrator是什么
MultiAgent Orchestrator 是用于管理和协调多个智能代理(Agent)的框架。通过分类器识别用户输入的意图,将请求分配给最适合的代理进行...
IMAGPose–南京理工大学推出姿态引导图像生成的统一框架
AI工具百科:
IMAGPose是什么
IMAGPose 是南京理工大学推出的用于人体姿态引导图像生成的统一条件框架。解决传统方法在姿态引导的人物图像生成中存在的局限性,如无法同时生成多个不同...
AICompanion–Zoom推出的AI助手,具有记忆、推理、任务执行和协调能力
AI工具百科:
AI Companion是什么
AI Companion 是 Zoom 推出AI智能助手,基于记忆、推理、任务执行和协调四大功能,成为整个 Zoom 平台上的代理,帮助用户从重复繁琐的工作中解脱出来...
MindLLM–耶鲁联合剑桥等机构推出的医疗领域AI模型
AI工具百科:
MindLLM是什么
MindLLM 是耶鲁大学、达特茅斯学院和剑桥大学联合推出的AI模型,能将脑部功能性磁共振成像(fMRI)信号解码为自然语言文本。
MindLLM基于一个主体无关(s...
PieceitTogether–BriaAI等机构推出的图像生成框架
AI工具百科:
Piece it Together是什么
Piece it Together (PiT)是Bria AI等机构推出的创新图像生成框架,专门用在从部分视觉组件生成完整的概念图像。基于特定领域的先验知识,将用...

