Technology
or Google's multimodalembedding@001 Model
A Vertex AI foundation model that generates unified 1408-dimension vectors from text, image, and video inputs for cross-modal search.
Google's multimodalembedding@001 model (part of the Vertex AI ecosystem) maps diverse data types into a shared vector space. It processes text (up to 32 tokens), images (standard formats), and video (up to 120 seconds) to enable high-performance applications like semantic image retrieval and video content recommendation. By outputting a consistent 1408-dimensional embedding, it allows developers to calculate cosine similarity across different media formats without separate specialized encoders.
What builders pair with or Google's multimodalembedding@001 Model
Projects using both technologies. Select a pairing to see a project.
Pairing: CLIP
Let's talk about Embeddings
Pairing: Embedding Models like CLIP
Let's talk about Embeddings
Pairing: Image Classifier
Let's talk about Embeddings
Pairing: Image Search
Let's talk about Embeddings
Pairing: RAG
Let's talk about Embeddings
Recent Talks & Demos
Showing 1-1 of 1