Vid2World–清华联合重庆大学推出视频模型转为世界模型的框架
AI工具百科:
Vid2World是什么
Vid2World是清华大学联合重庆大学推出的创新框架,支持将全序列、非因果的被动视频扩散模型(VDM)转换为自回归、交互式、动作条件化的世界模型。模型基...
OpenMathNemotron–英伟达开源的数学推理系列模型
AI工具百科:
OpenMathNemotron是什么
OpenMathNemotron是英伟达推出的系列开源数学推理模型,专门用在解决复杂数学问题,包括奥林匹克级别的难题。模型基于大规模数据集OpenMathReaso...
DINOXSeek–IDEA研究院推出的多模态目标检测模型
AI工具百科:
DINOXSeek是什么
DINOXSeek 是 IDEA 研究院推出的多模态目标检测模型,结合视觉感知和自然语言理解能力。DINOXSeek基于复杂的语言描述精准定位图像中的目标,识别目标的...
WorldScore–斯坦福大学推出的世界生成模型统一评估基准
AI工具百科:
WorldScore是什么
WorldScore 是斯坦福大学提出的用于世界生成模型的统一评估基准。将世界生成分解为一系列的下一个场景生成任务,通过明确的基于相机轨迹的布局规范来实...
ReasonGraph–开源可视化与分析LLMs推理过程的AI工具
AI工具百科:
ReasonGraph是什么
ReasonGraph 是用在可视化和分析大语言模型(LLMs)推理过程的开源网络平台。ReasonGraph支持超过 50 种主流模型(如 Anthropic、OpenAI、Google 等)...
文心大模型4.5Turbo–百度推出的最新多模态大模型
AI工具百科:
文心大模型4.5 Turbo是什么
文心大模型4.5 Turbo是百度推出的高性能、低成本多模态大模型。基于文心大模型4.5的基础上进行优化,具备多模态、强推理能力,能处理文本、图...
RAGEN–训练大模型推理Agent的开源强化学习框架
AI工具百科:
RAGEN是什么
RAGEN是开源的强化学习框架,用于在交互式、随机环境中训练大型语言模型(LLM)推理Agent。基于StarPO(StateThinkingActionReward Policy Optimization)框...
MineWorld–微软研究院开源的实时交互式世界模型
AI工具百科:
MineWorld是什么
MineWorld是微软研究院开源的基于《我的世界》(Minecraft)的实时交互式世界模型,基于视觉动作自回归Transformer架构,将游戏场景和动作转化为离散的t...
AmazonNovaPremier–亚马逊推出的多模态AI模型
AI工具百科:
Amazon Nova Premier是什么
Amazon Nova Premier 是亚马逊推出功能最强大的多模态 AI 模型,能处理文本、图像和视频输入(不包括音频),擅长处理需要深度理解上下文、多步...
Granite4.0TinyPreview–IBM推出的语言模型
AI工具百科:
Granite 4.0 Tiny Preview是什么
Granite 4.0 Tiny Preview 是 IBM 推出的 Granite 4.0 语言模型家族中最小的模型的预览版本。Granite 4.0 Tiny Preview用极高的计算效率...
SocioVerse–复旦大学联合小红书等机构开源的社会模拟世界模型
AI工具百科:
SocioVerse是什么
SocioVerse(众生) 是复旦大学、上海创智学院、罗切斯特大学和小红书联合推出的社会模拟世界模型。基于大语言模型(LLM)驱动的智能体和包含1000万真...
RekaFlash3–RekaAI推出的开源推理模型
AI工具百科:
Reka Flash 3是什么
Reka Flash 3 是 Reka AI 推出的开源推理模型,拥有 21 亿参数。支持多模态输入,包括文本、图像、视频和音频,可处理最多 32k 个令牌的上下文长度,...

