MiniDALL·E3–北京理工联合上海AILab等高校推出的交互式文生图框架
AI工具百科:
Mini DALL·E 3是什么
Mini DALL·E 3 是北京理工大学、上海AI Lab、清华大学和香港中文大学联合推出的交互式文本到图像(iT2I)框架。基于自然语言与用户进行多轮对话,实...
VoiceCanvas–开源AI语音合成平台,支持多语言、多音色、声音克隆服务
AI工具百科:
VoiceCanvas是什么
VoiceCanvas 是开源的多语言语音合成平台。基于 AI 技术提供高质量的文字转语音服务,支持超过 50 种语言,集成 OpenAI TTS、AWS Polly 和 MiniMax 等...
AI推理模型有哪些?13个支持深度思考的推理模型
AI工具百科:
在当今数字化时代,人工智能正以前所未有的速度改变着我们的生活和工作方式。AI推理大模型作为人工智能领域的重要分支,以卓越的性能和广泛的应用前景,吸引了全球科技企...
PPTableMagic–百度飞桨团队开源的表格识别工具
AI工具百科:
PPTableMagic是什么
PPTableMagic 是百度飞桨团队推出的高性能表格识别工具,用在将图片中的表格结构化信息提取出来,转换为 HTML 等格式,进行进一步的数据处理和分析。...
OpenCodeReasoning–英伟达开源的代码推理AI模型
Ai工具百科:
Open Code Reasoning是什么
Open Code Reasoning(OCR)是英伟达开源的代码推理AI模型,基于Nemotron架构,专为提升代码推理和生成能力设计。OCR包含32B、14B和7B三种模...
DifyPlus–基于Dify二次开发的企业级增强版项目
AI工具百科:
DifyPlus是什么
DifyPlus 是基于 Dify 二次开发的企业级增强版项目,集成基于 ginvueadmin 的管理中心。DifyPlus在 Dify 基础上新增用户额度、密钥额度、Web 公开页登录...
Tesseract–开源的光学字符识别引擎,支持多种语言文字识别
AI工具百科:
Tesseract是什么
Tesseract 是开源的光学字符识别(OCR)引擎,Google 赞助开发的高精度免费的应用。支持多种语言,能识别 JPEG、PNG、TIFF 等常见图像格式中的文字内容...
AmazonNovaAct–亚马逊推出的通用AI智能体,自主执行网页任务
AI工具百科:
Amazon Nova Act是什么
Amazon Nova Act是亚马逊 AGI Labs推出的通用AI代理,用于在网页浏览器中执行任务。Amazon Nova Act支持开发者基于配套的 SDK 构建智能体应用原型...
QLIP–英伟达推出的视觉标记化方法
AI工具百科:
QLIP是什么
QLIP(Quantized LanguageImage Pretraining)是英伟达等推出的视觉标记化方法,结合高质量的图像重建和零样本图像理解能力。QLIP二进制球形量化(BSQ)的自...
Droidrun–开源AI手机操作工具,支持Agent操作Android手机
AI工具百科:
Droidrun是什么
Droidrun 是AI手机操作工具,支持 AI Agent像人类一样操作 Android 手机。Droidrun由运行在电脑或云端的 LLM 智能体和安装在手机上的 DroidRun Portal Ap...
AutoAgent–港大推出的AI智能体框架,零代码创建智能助手
Ai工具百科:
AutoAgent是什么
AutoAgent 是香港大学推出的零代码、自动化 LLM 智能体框架。基于自然语言交互,让用户无需编程即可创建智能助手,适用于智能搜索、数据分析、报告生成...
Graphiti–开源AI动态知识图谱生成框架
AI工具百科:
Graphiti是什么
Graphiti 是为动态环境设计的 AI 知识图谱生成框架,为 AI 智能体构建能查询、具有时间感知能力的知识网络。Graphiti 能实时摄取和处理结构化与非结构化...

