Doubao-Embedding-Vision
Multimodal embedding model supporting text, image and video input with up to 2048 dimensions.
Specs
- Context
- 131.1K
- Max output
- —
- Input price
- ¥0.7/ 1M tokens
- Output price
- —
- Released
- —
Context
- Context window
- 131.1K
- Max input
- —
- Max output
- —
Pricing · CNY / 1M tokens
- Input
- ¥0.7
- Output
- —
- Cache read
- —
- Cache write
- —
Modalities
- Input
- TextImageVideo
- Output
- Embedding
API
- API types
Reasoning
- Reasoning
- No
Info
- Status
- Active
- Released
- —
- Knowledge cutoff
- —
Features
- Not published
How to call
1 provider
bytedancemodel = doubao-embedding-vision-251215
embeddings
POSThttps://ark.cn-beijing.volces.com/api/v3/embeddings/multimodal
JSON
Standard format
{
"id": "doubao-embedding-vision",
"object": "model",
"created": null,
"owned_by": "bytedance",
"name": "Doubao-Embedding-Vision",
"api": {
"types": [
"embeddings"
]
},
"limits": {
"context": 131072,
"input": null,
"output": null
},
"modalities": {
"input": [
"text",
"image",
"video"
],
"output": [
"embedding"
]
},
"reasoning": {
"supported": false,
"efforts": []
},
"pricing": {
"currency": "CNY",
"unit": "1M_tokens",
"input": 0.7,
"output": null,
"cache_read": null,
"cache_write": null
},
"features": [],
"info": {
"status": "active",
"release_date": null,
"knowledge_cutoff": null,
"description": "Multimodal embedding model supporting text, image and video input with up to 2048 dimensions.",
"docs": "https://www.volcengine.com/docs/82379/1330310",
"verified_at": "2026-10-10"
}
}Official sources
3