Qwen3-VL-235B-A22B Thinking — это мультимодальная модель, которая объединяет мощную генерацию текста с визуальным пониманием изображений и видео. Модель Thinking оптимизирована для мультимодального анализа в области STEM и математики. Серия делает акцент на надёжном восприятии (распознавание разнообразных реальных и синтетических категорий), пространственном понимании (2D/3D привязка) и долгосрочном визуальном осмыслении, показывая конкурентоспособные результаты в публичных мультимодальных бенчмарках как по восприятию, так и по анализу. Помимо анализа, Qwen3-VL поддерживает агентское взаимодействие и использование инструментов: она может следовать сложным инструкциям в многоизобразочных, многоходовых диалогах; сопоставлять текст с временными шкалами видео для точных временных запросов; и управлять элементами GUI для задач автоматизации. Модели также позволяют использовать рабочие процессы визуального кодирования, превращая эскизы или макеты в код и помогая с отладкой пользовательского интерфейса, сохраняя при этом высокую производительность только текстового режима, сравнимую с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящей для производственных сценариев, охватывающих ИИ для документов, многоязычное оптическое распознавание символов, помощь в разработке/интерфейсе, пространственные/воплощённые задачи и исследования в области агентов зрения-языка.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-thinking",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegerstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberseedintegerlogprobsbooleantop_logprobsintegerresponse_formatobjectstructured_outputsbooleantoolsarraytool_choicestring | objectreasoningobjectinclude_reasoningboolean