ModelInfo
English
All models

Doubao-Embedding-Vision

Multimodal embedding model supporting text, image and video input with up to 2048 dimensions.

ByteDancedoubao-embedding-visionReport incorrect data

Specs

Context
131.1K
Max output
—
Input price
¥0.7/ 1M tokens
Output price
—
Released
—

Context

Context window
131.1K
Max input
—
Max output
—

Pricing · CNY / 1M tokens

Input
¥0.7
Output
—
Cache read
—
Cache write
—

Modalities

Input
TextImageVideo
Output
Embedding

API

API types
embeddings

Reasoning

Reasoning
No

Info

Status
Active
Released
—
Knowledge cutoff
—

Features

Not published
Source · official docsVerified 2026-10-10

How to call

1 provider

bytedancemodel = doubao-embedding-vision-251215

embeddings
POSThttps://ark.cn-beijing.volces.com/api/v3/embeddings/multimodal

JSON

Standard format
doubao-embedding-vision.json
{
  "id": "doubao-embedding-vision",
  "object": "model",
  "created": null,
  "owned_by": "bytedance",
  "name": "Doubao-Embedding-Vision",
  "api": {
    "types": [
      "embeddings"
    ]
  },
  "limits": {
    "context": 131072,
    "input": null,
    "output": null
  },
  "modalities": {
    "input": [
      "text",
      "image",
      "video"
    ],
    "output": [
      "embedding"
    ]
  },
  "reasoning": {
    "supported": false,
    "efforts": []
  },
  "pricing": {
    "currency": "CNY",
    "unit": "1M_tokens",
    "input": 0.7,
    "output": null,
    "cache_read": null,
    "cache_write": null
  },
  "features": [],
  "info": {
    "status": "active",
    "release_date": null,
    "knowledge_cutoff": null,
    "description": "Multimodal embedding model supporting text, image and video input with up to 2048 dimensions.",
    "docs": "https://www.volcengine.com/docs/82379/1330310",
    "verified_at": "2026-10-10"
  }
}

Official sources

3