Mercury 2.5 — это самая быстрая логическая LLM и новейшая диффузионная LLM (dLLM) от Inception. Вместо последовательной генерации токенов Mercury 2.5 генерирует и уточняет несколько токенов параллельно, достигая скорости 1107 токенов/сек на стандартных графических процессорах. Он обеспечивает повышение интеллекта более чем на 10 пунктов по сравнению с Mercury 2, качество сопоставимо с оптимизированными по стоимости передовыми моделями, такими как GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5. Mercury 2.5 поддерживает настраиваемые уровни рассуждений, параллельные вызовы инструментов и вывод JSON, согласованный со схемой. Он создан для производственных рабочих нагрузок, где задержка усугубляется: поисковые агенты, голосовые конвейеры и вспомогательные агенты кодирования.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="inception/mercury-2.5-preview",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegerstopstring | string[]response_formatobjectstructured_outputsbooleantoolsarraytool_choicestring | objectreasoningobjectreasoning_effortstringinclude_reasoningboolean