*Ling-3.0-flash* — это *модель Mixture-of-Experts (MoE) с 124 миллиардами параметров*, при этом *на каждый токен активируется приблизительно 5,1 миллиарда параметров*. Модель разработана с учётом таких ключевых приоритетов, как *эффективность использования токенов и агентивные выводы в производственном масштабе*, что позволяет разработчикам выполнять больше полезной работы в условиях ограниченных бюджетов на токены, задержки и затраты на обслуживание.
from openai import OpenAI
client = OpenAI(
base_url="https://infergate.ru/api/v1",
api_key="sk-•••",
)
resp = client.chat.completions.create(
model="inclusionai/ling-3.0-flash",
messages=[{"role": "user", "content": "Привет!"}],
)
print(resp.choices[0].message.content)modelstringобязательныйmessagesarrayобязательныйtemperaturenumbermax_tokensintegertop_pnumbertop_kintegermin_pnumberstopstring | string[]frequency_penaltynumberpresence_penaltynumberrepetition_penaltynumberseedintegerlogit_biasobjectlogprobsbooleantop_logprobsintegerresponse_formatobjecttoolsarraytool_choicestring | objectreasoningobjectinclude_reasoningboolean