Qwen3-VL-8B-Instruct — это мультимодальная визуально-языковая модель из серии Qwen3-VL, созданная для высокоточного понимания и анализа текста, изображений и видео. Она отличается улучшенным мультимодальным синтезом с Interleaved-MRoPE для долгосрочного временного анализа, DeepStack для детального визуально-текстового сопоставления и текстово-временным сопоставлением для точной локализации событий. Модель поддерживает нативное контекстное окно в 256 тысяч токенов, расширяемое до 1 миллиона токенов, и обрабатывает как статические, так и динамические медиавходы для таких задач, как анализ документов, ответ на вопросы по изображениям, пространственное мышление и управление графическим интерфейсом. Она достигает понимания текста, сопоставимого с ведущими большими языковыми моделями, при этом расширяя охват оптического распознавания символов до 32 языков и повышая устойчивость в различных визуальных условиях.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="qwen/qwen3-vl-8b-instruct",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegerstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberseedintegerlogit_biasobjectlogprobsbooleantop_logprobsintegerresponse_formatobjectstructured_outputsbooleantoolsarraytool_choicestring | object