跳到内容
//
AI RESOURCE
HUB
资源索引
用途
合集
对比
提示词
教程
术语表
搜索资源...
⌘K
简体中文
首页
/
术语表
/
多模态
多模态
能理解并生成文本、图像、音频、视频等多种数据类型的模型。
例如,你可以给多模态模型一张截图并让它写出该界面的代码,或给它一张图表让它分析。GPT 和 Gemini 是广泛使用的多模态模型。
相关资源
Google Gemini API 文档
Google Gemini API 官方文档,在统一的多模态接口中涵盖文本、图像、音频和视频理解。包含认证、函数调用、上下文缓存和代码执行的指南,并提供慷慨的免费额度供实验使用。适合需要在单次请求中处理多种内容类型的应用开发者。
LAION 开放多模态数据集
LAION(大规模人工智能开放网络)提供海量开源图文对数据集,已被广泛用于训练 CLIP、Stable Diffusion 等多模态模型。这些数据集免费开放,是开源生成式 AI 研究的重要基础设施。