🚀 Open-Source и платные ИИ-модели
Календарь релизов 2025–2026
Отслеживайте последние релизы ИИ-моделей: от бесплатных open-source до платных облачных решений.
264
Дней отслеживается
149
Дней релизов
839
Моделей
–
Август
2026
📅 24.08
5 моделей
Laguna S 2.1
открытая MoE-модель (Mixture of Experts, смесь экспертов) на 118B параметров (8B активных) от Poolside для агентного кодинга, контекст 1M токенов, лицензия OpenMDW-1.1…
Wan3.0-Video
закрытая text-to-video (T2V) модель Alibaba: ролики до 30 секунд в 480P–1080P из текста, изображений и документов (PDF/PPT) с референсным сохранением персонажей…
Thomson 1.0
первый собственный LLM Thomson Reuters: дообучен из открытой базы (Qwen) за $40 млн на корпусах Westlaw/Practical Law для юридических и налоговых задач, LegalBench 0.823…
GLiNER2.5
семейство NER-моделей (извлечение именованных сущностей) от Fastino на энкодерах DeBERTa-v3: чекпоинты 74M/194M/287M параметров, лицензия Apache 2.0…
GEN-1.5
закрытая робототехническая модель Generalist AI: мультимодальный трансформер (видео, сенсоры, язык, проприоцепция) с памятью 30 секунд и выдачей действий на 100 Гц…
📅 20.08
8 моделей
dots3-note Preview
Первая открытая модель Xiaohongshu (лаборатория dots.studio): MoE-архитектура (Mixture of Experts) на 280B параметров, 16B активных, контекст 512K токенов; понимает текст, изображения, видео и звук…
Ling-3.0-tiny-base
Базовая версия (без пост-тренинга) MoE-модели Ling-3.0-tiny от Ant Group: 7.9B параметров, из них 1.3B активных. Открыты чекпоинты трёх стадий обучения — претрейн, мидтрейн и финал — для дообучения под код и RL-исследования; лицензия MIT (h…
Ling-3.0-flash-base
Базовая версия флагманской MoE-модели Ling-3.0-flash от Ant Group на 124B параметров (5.1B активных) с поддержкой длинного контекста…
LFM2.5-DSpark
Черновые (draft) модели Liquid AI по ~300M параметров для спекулятивного декодирования LFM2.5: ускоряют инференс до 3,2 раза без изменения выходов — до 1362 токенов/с на H100 и 389 на MacBook…
LFM2.5 QAD Q4_0
Q4_0 GGUF-чекпоинты моделей LFM2.5 (230M, 350M, 1.2B, 2.6B) от Liquid AI, обученные методом QAD — дистилляцией с учётом квантования, возвращающей 97% точности BF16 при том же размере…
S1-mini
Открытая модель Superwhisper на 0.6B параметров (файнтюн Qwen3-0.6B), превращающая сырые транскрипты распознавания речи (ASR) в чистый текст: убирает слова-паразиты, расставляет пунктуацию, форматирует письма и списки…
FastWan-QAD
Семейство моделей генерации видео Hao AI Lab на базе Wan2.x размерами 1.3B/5B/14B: дистилляция с учётом квантования (QAD) и трёхшаговый сэмплер позволяют RTX 5090 генерировать 5 секунд видео 480p за 1,8 секунды, а Mac — за ~30 секунд…
GEN-1.5
Робототехническая фундаментальная модель стартапа Generalist AI (основатели — выходцы из DeepMind и Boston Dynamics): vision-language-action архитектура обрабатывает видео, сенсоры и язык и выдаёт действия с частотой 100 Гц…
📅 13.08
8 моделей
DeepSeek-V4-Pro
флагманская MoE-модель (Mixture of Experts) DeepSeek на 1,6T параметров (49B активных) с контекстом 1M токенов, официально вышедшая из четырёхмесячного превью; заточена под агентные задачи: поддержка Responses API, интеграция с Codex и спек…
Qwen3.8-2.4T-A95B
первый открытый флагман уровня Max от Alibaba Qwen: MoE-модель на 2,4T параметров (95B активных, 512 экспертов на слой) с контекстом 262K токенов, расширяемым до ~1M; работает в режиме размышлений по умолчанию и набирает 93,0 на PaperBench…
Motif-3
финальный релиз открытой MoE-модели южнокорейской Motif Technologies на 314B параметров (13,2B активных) с фирменным вниманием GDLA и контекстом 256K токенов; обучена на 12,5T токенов и набирает 47 баллов на Artificial Analysis Intelligence…
Ling 3.0 Flash
открытая MoE-модель inclusionAI (Ant Group) на 127B параметров; по данным Artificial Analysis — самая умная открытая модель среди систем с менее чем 124B суммарных параметров (38 баллов AAII), галлюцинации снижены с 97% до 44% в тесте Omnis…
Intern-S2-Preview-397B
научная агентная мультимодальная MoE-модель Shanghai AI Laboratory (InternLM) на 397B параметров (~120B активных) с опциональным модулем памяти Intern-MemDec-4B; умеет понимать, рассуждать и генерировать в научных задачах, включая прогнозир…
Gemini 3.7 Flash
закрытая модель Google для кодинга и агентных рабочих процессов, вышедшая всего через три недели после Gemini 3.6 Flash; контекст 1M токенов с мультимодальным вводом, рост FrontierCode 1.1 с 34,4% до 43,6% и DeepSWE v1.1 с 49% до 65,3%; дос…
Palmyra X6
флагманская модель Writer для корпоративных агентных задач, пост-тренировочная вариация открытой GLM-5.2 от Z.ai; генерирует 82 токена/с, выполняет задачи в среднем за 26 секунд и до 8 часов работает автономно без дрейфа; доступна только че…
Dyna-2
world-action модель Dyna Robotics для манипуляции роботами, обученная на более чем 1M часов эгоцентрического видео людей; на видео-диффузионной основе совместно денойзит будущее видео и чанк действий, впервые перенося scaling-законы zero-sh…
📅 12.08
5 моделей
Grok 4.6
Флагманская закрытая модель xAI (SpaceXAI): ~1,5T параметров, контекст 500K токенов, заточена под долгоработающих агентов, кодинг и визуальные проекты; $2/$6 за 1M токенов…
Qwen3.8-2.4T-A95B
Гигантская текстовая модель Alibaba Qwen на MoE-архитектуре (Mixture of Experts): 2,4T параметров, 95B активных; нативный контекст 262K, расширяется до 1M токенов…
DeepSeek V4 Pro 0813
Стабильная версия флагманской закрытой модели DeepSeek V4 Pro: контекст 1M токенов, вывод до 384K, поддержка Responses API и Anthropic-совместимого эндпоинта…
LFM2.5-VL-3B
Компактная vision-language модель (VLM) от Liquid AI на 3,1B параметров: текстовый бэкбон LFM2.5-2.6B + энкодер зрения SigLIP2 NaFlex 400M — для edge-устройств и локальных агентов: чтение UI, OCR, вызов функций…
North Micro Vision Instruct
Самая маленькая VLM от Cohere на 2,4B параметров (энкодер зрения 400M + LLM North Micro 2B) для документного понимания: извлечение структурированных данных, таблицы и мультиязычные изображения в нативном разрешении…
📅 11.08
7 моделей
Nemotron 3.5 Lightning
30B-параметрическая MoE-модель (Mixture of Experts — смесь экспертов, 3B активных на токен) от NVIDIA с гибридной Mamba-2–Transformer-архитектурой и контекстом до 1M токенов; ориентирована на высокоскоростные агентные задачи: code review, t…
Muse Glimmer
30B-параметрическая плотная (Dense) мультимодальная causal-модель от Meta Superintelligence Labs с ViT-G/14-визуальным энкодером (~2B), контекстом 131K токенов и поддержкой 100+ языков; заточена под always-on-агентов на потребительских GPU…
Ling-3.0-tiny
сверхкомпактная MoE-модель от Ant Group/InclusionAI (Китай) на 7.9B параметров, всего 1.3B активных на токен (128 экспертов, 8 активных + 1 shared); гибридное внимание — чередование KDA (Kimi Dilation Attention от Moonshot AI) и MLA (Multi-…
LTX-2.5
опенвейт-модель мира (world model) от компании LTX (экс-Lightricks, Израиль) для генерации видео, робототехники и физического ИИ; новый диффузионный видеодекодер + языковой backbone Gemma 4, нативная многокадровая (multishot) генерация с со…
Fastino-Nemotron-3.5-Lightning-Finance
доменно-специализированная финансовая модель от Fastino Labs, полученная посттренингом NVIDIA Nemotron 3.5 Lightning (30B MoE, 3B активных) полностью автономным файнтюнинг-агентом менее чем за 10 часов. Лицензия Apache 2.0…
Fastino-Nemotron-3.5-Lightning-Healthcare
доменно-специализированная медицинская модель от Fastino Labs, также созданная автономным посттренингом Nemotron 3.5 Lightning под Apache 2.0…
GPT-5.6-Cyber
закрытая кибербезопасная модель OpenAI на базе флагманского GPT-5.6 Sol, специально дообученная под поиск zero-day-уязвимостей, разработку эксплойтов, пентесты и анализ защищённости; выполняет 95% продвинутых offensive-задач (exploit chain…
📅 07.08
4 модели
smolvla_so101_tb4_pick_place_Sujith_080726_aug
компактная VLA (vision-language-action) модель на 0.5B параметров от MoAIBo, оптимизированная для задач робототехники, таких как захват и перемещение объектов; веса доступны на HuggingFace (https://huggingface.co/MoAIBo/smolvla_so101_tb4_pi…
OpenAI Astra
новая мультимодальная модель от OpenAI, которая стала предметом обсуждения из-за потенциальных рисков в сфере кибербезопасности; доступ предоставляется исключительно через закрытый API (https://the-decoder.com/openai-flags-imposes-its-new-a…
GPT-5.6 Sol
обновленная версия модели от OpenAI, интегрированная в сервис ChatGPT для улучшения качества ответов; доступ к расширенным возможностям ограничен для пользователей бесплатного тарифа (https://the-decoder.com/openai-improves-gpt-5-6-sol-in-c…
Claude 5 Series
семейство моделей (Opus и Sonnet) от Anthropic, для которых сегодня были представлены критические обновления механизмов биологической безопасности; доступ осуществляется через API и подписку (https://www.anthotpic.com/news)
📅 05.08
8 моделей
Qwen3.8-Max
флагманская мультимодальная MoE-модель (Mixture of Experts) от Alibaba на 2,4 трлн параметров (~95 млрд активных) с контекстом 1 млн токенов; понимает текст, изображения, аудио и видео, умеет автономно управлять компьютером (computer use)…
Meta Muse Spark 1.2
модель для кодинга от Meta Superintelligence Labs под руководством Александрa Ванга; ко-тренировалась в паре с агентом Muse Code на разнообразных dev-окружениях…
Meta Muse Code
первый AI-агент для программирования от Meta; терминальное приложение (macOS/Linux), умеет планировать изменения, писать код и валидировать результаты в больших репозиториях…
NVIDIA Alpamayo 2 Super
открытая модель рассуждений для автономного вождения от NVIDIA на 34 млрд параметров (~3× предыдущее поколение), построена на архитектуре Cosmos 3 Super Reasoner с пост-тренингом через reinforcement learning…
Liquid AI LFM2.5-2.6B
компактная модель на 2,69 млрд параметров от MIT-спин-оффа Liquid AI для запуска AI-агентов полностью на устройстве (смартфон, ноутбук, робот) без облака…
Mistral Shieldstral 1.0-3B
открытый мультимодальный классификатор безопасности от Mistral AI на 3 млрд параметров, умещающийся на одной 16 ГБ GPU. Вместо жёстко заданных категорий вреда принимает политику модерации в виде вопроса на естественном языке (policy-as-inpu…
AntBabel Ling-3.0-flash
открытая MoE-модель от Ant Group (inclusionAI) на 124 млрд параметров (всего 5,1 млрд активных на токен) с гибридным линейным вниманием: 35 слоёв KDA (Kimi Delta Attention) чередуются с 7 слоями MLA (Multi-head Latent Attention) в пропорции…
Tencent Hy3
флагманская модель Tencent (ранее Hunyuan) на 295 млрд параметров / 21 млрд активных, архитектура MoE со 192 экспертами (top-8) и гибридным fast-and-slow-thinking…
📅 04.08
9 моделей
Qwen3.8-Max
флагманская MoE-модель (Mixture of Experts) от Alibaba Qwen на 2.4T параметров (~95B активных) с контекстом 1M токенов и нативным мультимодальным пониманием (текст, изображения, видео); API $2/$6 за 1M токенов, веса обещаны открыть на следу…
MiniMax H3
omni-модальная generative-модель от MiniMax для создания видео 4–15 секунд в 2K-разрешении с нативным стереозвуком 32kHz; понимает текст, изображения, видео и аудио на 11 языках; веса открыты под Community License на HuggingFace, #1 в мире…
Alpamayo 2 Super
VLA-модель (vision-language-action) от NVIDIA для L4-автономного вождения (~32B параметров), построена на базе Cosmos 3 Super Reasoner с пост-тренировкой reinforcement learning; обеспечивает 360° восприятие с семи камер и выдаёт пять связан…
GPT-Live
голосовая full-duplex-система третьего поколения от OpenAI для ChatGPT Voice, позволяющая AI слушать и говорить одновременно без детектора окончания реплики; архитектура разделяет быстрый голосовой обмен и тяжёлый reasoning (делегируется ba…
Ling 3.0 Flash FP8
открытая гибридно-линейная MoE-модель от InclusionAI (Ant Group) на 124B параметров (5.1B активных) с контекстом 262K токенов; FP8-квантизация, лицензия MIT, два режима — thinking и non-thinking; SGLang HiCache + Mooncake-кэширование сокращ…
LFM2.5-2.6B
гибридная модель на 2.69B параметров от Liquid AI (MIT CSAIL spin-out) для on-device-агентов: планирование, tool-calling, многошаговые задачи; 128K контекст, менее 2.5 GB на CPU, 220 tok/s на Apple M5 Max и ~30 tok/s на телефоне; 22 свёрточ…
NemotronLabs VoiceChat 11B
первая открытая full-duplex-голосовая модель от NVIDIA, способная вызывать инструменты (tool calling) прямо во время разговора; единая streaming-сеть: Fast Conformer-энкодер (16kHz) + Nemotron Nano v2 9B (гибрид Mamba/Transformer) + TTS-дек…
SenseNova U1.5-Lite-Preview
унифицированная мультимодальная модель от SenseTime (商汤) на архитектуре NEO-Unify, всего 8B-MoT параметров, но с нативной генерацией 4K-изображений, точным редактированием и вёрсткой текста (постеры, инфографика); объединяет понимание, гене…
Hy ASR 3.0 preview
модель распознавания речи от Tencent Hunyuan (腾讯混元) на базе MoE-архитектуры Hy3 LLM с самообучающимся речевым энкодером (десятки миллионов часов аудио); объединяет высокоточную транскрипцию с семантическим пониманием контекста; WER 3.34% (м…
📅 03.08
4 модели
Qwen3.8-Max
Флагманская MoE-модель (Mixture of Experts) Alibaba/Qwen Team на 2.4T параметров (95B активных) с контекстом 1M токенов и нативной мультимодальностью (текст, изображения, видео)…
MiniMax H3
Омни-модальная система генерации видео от MiniMax: dense DiT-трансформер на 33B параметров генерирует видео до 15 сек (768p, 24 FPS) с нативным стереозвуком 32 кГц по тексту, изображениям, видео и аудио (до 9 изображений, 3 видео и 3 аудио…
Cogent AI VR-1
Специализированная reasoning-модель от Cogent AI для кибербезопасности: составляет и верифицирует полные цепочки атаки на предприятие — cloud, identity, runtime, CI/CD, SaaS — а не ищет отдельные уязвимости…
ByteDance Seedance 2.5
Модель генерации видео нового поколения от ByteDance Seed Team: единый проход до 30 сек видео с синхронизированным аудио (против 15 сек у Seedance 2.0), до 50 референсных ассетов (изображения, видео, аудио, 3D white-model, хромакей), timest…
📅 01.08
3 модели
Nanbeige4.2-3B
агентная модель от Nanbeige Lab (подразделение BOSS Zhipin, Пекин) на 3B параметров с архитектурой Looped Transformer — веса трансформера переиспользуются за два прохода, увеличивая ёмкость без роста параметров…
AMD Instella-MoE-16B-A3B
полностью открытая MoE-модель (Mixture of Experts — смесь экспертов) от AMD на 16B общих параметров (2.8B активных на токен), обучена с нуля на 7.1T токенов на ускорителях Instinct MI300X/MI325X…
Jina Reranker v3.5
списочный реранкер (listwise reranker) на 0.6B параметров от Jina AI с гибридным вниманием 3L2G (sliding window + global attention), снижающим вычислительную сложность с квадратичной до линейной…
Июль
2026
📅 30.07
9 моделей
Grok Voice Think Fast 2.0
SpaceXAI (xAI), next-gen speech-to-speech модель на базе Grok 4.5: занимает 1-е место на Tau Voice agent benchmark (56.5%) и 2-е на Artificial Analysis Speech-to-Speech Index (82.9%), время первого аудио-ответа — 0.70 сек; цена $0.08 за ауд…
Grok 4.5
SpaceXAI (xAI), флагманская MoE-модель (Mixture of Experts) на 1.5 трлн параметров с контекстным окном до 500K токенов; SWE-Bench Pro — 64.7% (выше GPT-5.5 и Opus 4.7), Terminal-Bench 2.1 — 83.3%, скорость инференса 80 TPS; цена $2 за 1M вх…
Gemini Robotics ER 2
Google DeepMind, VLM (vision-language model) для embodied reasoning — «высокоуровневый мозг» робота: понимает непрерывное видео, отслеживает прогресс задачи, сам исправляет ошибки, планирует многошаговые операции длительностью в несколько м…
Gemini Robotics 2
Google DeepMind, VLA-модель (vision-language-action) для полного телесного управления гуманоидными роботами: от ходьбы и приседаний до мелкой моторики 22-степенных кистей (92% точности выкручивания лампочки, 76.3% — захват предметов с полки…
Gemini Robotics On-Device 2
Google DeepMind, компактная VLA-модель, работающая локально на устройстве робота без облачных запросов; адаптируется к новым конфигурациям роботов за несколько часов дообучения; early-access для партнёров (https://deepmind.google/blog/gemin…
Inkling Small
Thinking Machines Lab (основана Мирой Мурати, экс-CTO OpenAI), MoE-трансформер на 276B всего / 12B активных параметров (6 из 256 экспертов), мультимодальный — текст + изображения + аудио на входе, контекст до 1M токенов; лицензия Apache 2.0…
VisionPsy-Nano
Tether Data (подразделение QVAC), сверхкомпактная VLM на ∼460M параметров: SigLIP2-вижн-энкодер + SmolLM2-360M-языковая основа, контекст 8192 токена, поддержка тайлинга изображений до 2048px; лицензия Apache 2.0; лучшая среди всех sub-0.5B…
Gemini Spark
Google, персональный AI-агент на базе Gemini 3.5/3.6, работающий 24/7 в фоне (даже при заблокированном экране или закрытом ноутбуке) на облачных виртуальных машинах Google; нативно интегрирован с Google Workspace (Gmail, Docs, Sheets, Calen…
Lyria 3.5
Google DeepMind, нейросеть для генерации музыки: улучшенная мелодичность (богатые, естественные переходы между секциями), более реалистичный вокал с эмоциональной экспрессией и точным произношением, гибкое управление темпом (BPM) и длительн…
📅 29.07
12 моделей
A.X K2
флагманская MoE-модель (Mixture of Experts) на 688B параметров (33B активных на токен) от SK Telecom, крупнейшая в суверенной AI-программе Южной Кореи; декодер-трансформер с 256 экспертами, контекст 262K токенов (расширяется до 512K через Y…
A.X K2 ALM
аудио-языковая модель (Audio Language Model) на 22B параметров от SK Telecom, предназначена для анализа голосовых звонков, консультаций и совещаний; способна распознавать и интерпретировать аудио из контакт-центров и производственных сред…
A.X K2 Raon-Speech
голосовая AI-модель на 21B параметров (3B активных), совместная разработка Krafton и SK Telecom для игровых AI-персонажей; комбинирует малую языковую модель A.X K2 с голосовым энкодером и кодеком Krafton для прямого понимания и генерации ре…
GPT Transcribe
модель распознавания речи от OpenAI для асинхронной транскрипции аудиофайлов и batch-нагрузок; работает в ~34 раза быстрее реального времени, Word Error Rate 3.31% (против 40.37% у Whisper на Common Voice), поддерживает контекстные подсказк…
GPT Live Transcribe
потоковая модель распознавания речи OpenAI для реального времени: живые субтитры, транскрипция звонков, микрофонный ввод; пониженная задержка по сравнению с GPT Transcribe, улучшенное понимание акцентов и технической терминологии в зашумлён…
Lyria 3.5
модель генерации музыки от Google DeepMind, запущена в Google Flow Music; улучшенная мелодичность, реалистичный вокал с эмоциональными нюансами, структурное понимание текстов песен (куплеты, припевы); пользователь управляет темпом (BPM) и д…
LFM2.5-Encoder-230M и LFM2.5-Encoder-350M
семейство bidirectional-энкодеров от Liquid AI на гибридной архитектуре LFM2 (gated convolution + grouped-query attention), адаптированных из decoder-моделей под понимание текста (MLM с 30% masking rate, контекст 8192 токена); на CPU при по…
Pangram 4
модель детекции AI-сгенерированного текста от Pangram Labs (Стэнфорд), построена на MoE-архитектуре (Mixture of Experts) со специализированными головами для детекции «очеловечивателей» (humanizer-обход), посегментного анализа и смешанного а…
Shieldstral
мультимодальный классификатор безопасности на 3B параметров от Mistral AI, формулирует модерацию контента как бинарный вопросно-ответный task; одна модель обрабатывает текст и изображения одновременно, политика модерации задаётся естественн…
MODUS
декодерная any-to-any-модель от EPFL VILAB (совместно с Apple, U. Copenhagen, CUHK и Lambda AI) для генерации 16 модальностей (RGB, глубина, нормали, сегментация, Canny-границы, SAM-маски, DINOv2/CLIP/ImageBind-фичи и др.) в едином causal-т…
GPT-Red
фреймворк автоматизированного red-teaming от OpenAI, использующий self-play (самоигру) для масштабного поиска уязвимостей языковых моделей; опубликован как исследовательская статья 29 июля с кодом; вместо ручного тестирования модель-атакующ…
Mage-VL
лёгкая потоковая multimodal-модель от Microsoft на 4B параметров для понимания видео: изображения, frame-сэмплированное видео, H.264/HEVC-видео и event-gated-стриминг; визуальный энкодер Mage-ViT (с нуля) + Qwen3-4B-Instruct как языковой ba…
📅 27.07
7 моделей
Kimi K3
Открытая MoE-модель (Mixture of Experts) на 2,8 трлн параметров (~50B активных, 896 экспертов с top-16 роутингом) от китайской Moonshot AI…
NVIDIA Cosmos-H-Dreams
Генеративный симулятор реального времени для хирургической робототехники от NVIDIA: causal-модель, дистиллированная из Cosmos-Predict2.5-2B методом self-forcing distillation…
MAI-Cyber-1-Flash
Первая специализированная кибербезопасная модель Microsoft: компактный дериватив MAI-Thinking-1 (~10× меньше GPT-5.4), заточенный под поиск, верификацию и исправление уязвимостей в коде…
Celeris-1
Диффузионная языковая модель от стартапа Celeris (основатели Tom Hamer и Jesse Clark — экс-Margo, backed by Lightspeed Venture Partners): генерирует текст не авторегрессивно, а параллельным уточнением «черновика» всего ответа за несколько п…
Claude Opus 5 (Anthropic)
выпущен 24 июля, широко освещался 27 июля, но не является релизом этой даты
Muse Spark 1.1 (Meta)
модель от 9 июля; развёртывание agentic-функций Meta AI стартовало 27 июля, но сама модель не новая
AgentENV (Kimi AI / kvcache-ai)
инфраструктура для agentic RL, а не AI-модель; опенсорснут 27 июля вместе с K3
📅 23.07
3 модели
Solar Open 2
открытая агентная LLM от Upstage (Южная Корея) в рамках госинициативы «суверенной модели»; MoE-архитектура (Mixture of Experts) на 250B параметров с 15B активных, оптимизирована под повторяющиеся рассуждения и вызовы инструментов…
Laguna S 2.1
компактная модель для агентного кодинга от Poolside; MoE на 118B параметров (8B активных), контекст до 1M токенов, режимы с рассуждениями и без…
FLUX 3
мультимодальная frontier-модель от Black Forest Labs (Германия): единая архитектура для изображений, видео и звука с возможностью предсказания действий для робототехники…
📅 22.07
4 модели
Solar Open 2 (Solar-Open2-250B)
открытая LLM от корейской Upstage: MoE-архитектура (Mixture of Experts) на 250B параметров с 15B активными, гибридное внимание (линейные слои + softmax, без позиционных кодировок NoPE) и контекст до 1M токенов; заточена под агентные задачи…
Antares-350M / Antares-1B
семейство компактных моделей (SLM, small language model) на 350M и 1B параметров от Cisco Foundation AI для локализации известных уязвимостей прямо в больших кодовых базах; работают on-prem без выгрузки исходников в облако, дают уровень GPT…
TimeLens2
мультимодальная LLM для универсального temporal grounding в видео (поиск нужных моментов по текстовому запросу) от лаборатории MCG-NJU (Нанкинский университет); код и веса открыты на GitHub, статья вышла в топ-1 трендовых на HuggingFace за…
Cursor Router
обученный командой Cursor классификатор уровня запроса (request-level classifier), который маршрутизирует каждый запрос к оптимальной модели по сложности и типу задачи, обеспечивая фронтир-качество кодинга при затратах на 30–50% ниже; закры…
📅 20.07
3 модели
NVIDIA Cosmos 3 Edge
открытая world-модель («модель мира») на 4B параметров от NVIDIA с двумя трансформерными «башнями» (авторегрессионная для reasoning + диффузионная для генерации действий); помогает роботам понимать окружение и генерировать до 32 действий за…
RynnBrain 1.1
embodied-модель (воплощённый ИИ) от Alibaba DAMO Academy и Hupan Lab в трёх размерах (2B, 9B и 122B-A10B) на базе Qwen3.5; decoder-only VLM (vision-language-модель) для пространственного reasoning, локализации объектов, планирования манипул…
Qwen-Audio-3.0-TTS
закрытая облачная TTS-модель (text-to-speech, синтез речи) от Alibaba Tongyi Lab в тирах Flash (~300мс задержка) и Plus (качество); поддержка 16 языков и 20 китайских диалектов, клонирование голоса и 86 тегов эмоций, доступ только через API…
📅 17.07
2 модели
Nemotron 3 Embed
семейство открытых эмбеддинг-моделей от NVIDIA (чекпоинты 8B и 1B, трансформер-энкодер с двунаправленным вниманием на базе Ministral, контекст 32K токенов, 34 языка) для RAG (генерация с поиском по базе), агентного и кодового поиска; 8B-вер…
ZUNA1.1
открытая foundation-модель для ЭЭГ (электроэнцефалографии) от Zyphra на 380M параметров; диффузионный автоэнкодер на трансформере с 4D-ротационным кодированием координат (x, y, z, t), принимает сигналы переменной длины 0.5–30 сек, восстанав…
📅 15.07
4 модели
Inkling
открытая (open-weight) мультимодальная MoE-модель (Mixture of Experts) от Thinking Machines Lab Миры Мурати: 975B параметров (41B активных), обучена на 45 трлн токенов текста/изображений/аудио/видео, контекст до 1M токенов, регулируемое «ус…
Inkling-Small
облегчённая версия флагмана Thinking Machines Lab: открытая мультимодальная MoE-модель на 276B параметров (12B активных), обучена по схожему рецепту; позиционируется как основа для дообучения через платформу Tinker (превью) (https://thinkin…
Bonsai 27B
открытая reasoning-модель для запуска на устройстве от PrismML (основана исследователями Caltech) на базе Qwen3.6-27B; экстремальная 1–1.58-битная квантизация ужимает 27B до ~3.9 ГБ и запускает модель локально на iPhone 17 Pro (~11 ток/с)…
Soofi S 30B-A3B
открытая суверенная двуязычная (немецкий/английский) foundation-модель немецкого консорциума Soofi (Fraunhofer IAIS, DFKI, TU Darmstadt): гибридная MoE-архитектура Mamba-Transformer, ~31.6B параметров (3.2B активных), контекст до 1M токенов…
📅 12.07
3 модели
NeuroVFM
нейровизуализационная foundation-модель от команды University of Michigan (публикация в Nature Medicine); vision-only self-supervised энкодер на 85.8M параметров (есть вариант 21.7M), обучен методом Vol-JEPA (расширение I-JEPA/V-JEPA на объ…
Vidu S1
модель интерактивной генерации видео в реальном времени от Tsinghua University и Shengshu AI; на базе диффузионных фреймворков TurboDiffusion/TurboServe…
DrugGen 2
disease-aware языковая модель для поиска лекарств от Isfahan University of Medical Sciences (Иран); дообученная GPT-2 с двухэтапным обучением (SFT на 13 908 парах болезнь-мишень-препарат + оптимизация GRPO)…
📅 11.07
1 модель
LingBot-VA 2.0
video-action (видео-действие) foundation-модель для универсального управления роботами-манипуляторами от Robbyant (подразделение embodied AI в составе Ant Group); causal Diffusion Transformer (диффузионный трансформер) на ~15.3B параметров…
📅 10.07
5 моделей
MuScriptor
от Kyutai и команды Mirelo; декодер-only Transformer в трёх размерах (103M / 307M / 1.4B параметров), транскрибирует многоинструментальную музыку из аудио (мел-спектрограмм) в MIDI…
OpenCoF
от ByteDance Seed; видео-модель, дообученная поверх Wan2.2-I2V-A14B с MoE-архитектурой (Mixture of Experts) и блоками DiT (Diffusion Transformer, ~14B параметров), реализует Chain-of-Frame рассуждения через генерацию видео…
SAM-MT
от Fudan University; расширение Segment Anything 2 для сегментации нескольких объектов в видео в реальном времени, использует раздельный masked-attention и query-based память; держит 36+ FPS на 10 целях там, где SAM2 падает до 12.4 FPS (htt…
DrugGen 2
от Isfahan University of Medical Sciences; языковая модель на базе GPT-2, дообученная через SFT и RL-метод GRPO (Group Relative Policy Optimization), генерирует молекулы-кандидаты по онтологии болезни и последовательности белка-мишени для d…
SensorFM
от Google Research; foundation-модель для носимых устройств на базе ViT-1D (одномерный Vision Transformer) с masked-autoencoder, до 110M+ параметров, обучена на 1 трлн минут сенсорных сигналов от 5 млн человек; решает 35 задач прогноза здор…
📅 09.07
8 моделей
GPT-5.6 Sol
флагманская закрытая reasoning-модель OpenAI, старшая в трёхуровневом семействе; заточена под сложный кодинг, кибербезопасность, науку и долгие агентные задачи, набирает 80 в Artificial Analysis Coding Agent Index (выше Claude Fable 5) и 91…
GPT-5.6 Terra
средняя сбалансированная модель OpenAI с производительностью на уровне GPT-5.5, но вдвое дешевле; универсальный «повседневный» вариант для агентов и автоматизации, поддерживает Programmatic Tool Calling (запуск JS-кода в изолированном V8)…
GPT-5.6 Luna
самая быстрая и дешёвая модель семейства OpenAI GPT-5.6, оптимизирована под высокую пропускную способность и объёмные нагрузки; даёт 84.3% на Terminal-Bench 2.1 при минимальной цене; закрытая, доступ через API ($1/$6 за 1M токенов) (https:/…
Grok 4.5
новая закрытая модель xAI класса Opus для кодинга и агентных задач с контекстом 500K токенов и встроенными серверными инструментами (веб-поиск, поиск по X, исполнение кода); #4 из 168 в Artificial Analysis Intelligence Index и лучший резуль…
Muse Spark 1.1
первая платная API-модель Meta Superintelligence Labs (уход от привычной open-weights стратегии Meta); мультимодальная reasoning-модель с контекстом 1M токенов, принимает текст, изображения, видео и документы, умеет tool use, автоматизацию…
Nemotron-Labs-3-Puzzle-75B-A9B
открытая гибридная MoE-модель (Mixture of Experts) от NVIDIA на 75.3B параметров (9.3B активных), архитектура из чередующихся Mamba-, MoE- и attention-блоков со сжатием от Nemotron-3-Super; даёт ~2× серверной пропускной способности и держит…
GPT-Live-1
новая полнодуплексная голосовая модель OpenAI, заменяющая Advanced Voice Mode; непрерывно слушает и говорит одновременно, много раз в секунду решая говорить/слушать/перебить/вызвать инструмент, для сложных запросов делегирует фоновой fronti…
GPT-Live-1 mini
облегчённая версия полнодуплексной голосовой модели OpenAI для бесплатного тарифа ChatGPT; та же архитектура естественного живого диалога (реакции «mhmm», паузы, перебивания), глобальный роллаут на iOS, Android и ChatGPT.com; бесплатно толь…
📅 07.07
3 модели
Cohere Transcribe Arabic
открытая модель распознавания речи (ASR) на 2B параметров от Cohere, заточена под арабский: диалекты, арабско-английский code-switching и спец-лексика; лицензия Apache 2.0, люди предпочли её Whisper в 95.8% тестов (WER 25.87 на HF Arabic AS…
Nemotron-Labs-Audex-30B-A3B (Audex)
унифицированная аудио-текстовая MoE-модель (MoE — Mixture of Experts, «смесь экспертов») от NVIDIA: 30B параметров, 3B активных, гибрид Mamba-Transformer, контекст 1M токенов; умеет ASR, перевод речи, TTS (text-to-speech), генерацию аудио и…
LingBot-Vision
открытая vision-модель (самообучаемый энкодер) от Robbyant (подразделение Ant Group) для плотного пространственного восприятия роботов; семейство ViT до 1.1B параметров, обучено на 161M изображений методом masked boundary modeling; в оценке…
📅 06.07
4 модели
Hy3
открытая языковая MoE-модель (Mixture of Experts) от Tencent Hunyuan: 295B параметров (21B активных), контекст 256K токенов, объединяет «быстрое» и «медленное» мышление с усиленными агентными возможностями; лицензия Apache 2.0, веса выложен…
Wan-Streamer v0.2
интерактивная real-time (в реальном времени) foundation-модель от Wan-AI (Alibaba): единый трансформер потоково обрабатывает текст, аудио и видео и на входе, и на выходе через block-causal attention для полнодуплексного аудио-визуального об…
GigaWorld-1
world-model (модель мира) от GigaAI: задаёт методику построения моделей мира для оценки политик роботов в embodied AI (воплощённом ИИ), выступая симулятором для тестирования действий робота без реального железа; код и материалы открыты (htt…
ZCode
облачный агент для кодинга от Zhipu AI (Z.ai) на базе модели GLM-5.2 с контекстом 1M токенов: умеет читать файлы, терминал и браузер, интегрируется с Git; работает только в облаке, бесплатный 5-дневный триал до 5M токенов в день (https://zc…
📅 03.07
1 модель
Leanstral 1.5
открытая MoE-модель (Mixture of Experts: 119B параметров, 6B активных, 128 экспертов, контекст 256K) от Mistral AI для формальной верификации и доказательства теорем в Lean 4; решает 587/672 задач PutnamBench, полностью «сатурирует» miniF2F…
📅 02.07
1 модель
diffusion-gemma-asr-small
открытая мультиязычная ASR-модель (распознавание речи) от стартапа Interfaze (Y Combinator); адаптер на ~42M параметров поверх замороженного диффузионного бэкбона DiffusionGemma-26B и энкодера Whisper-small, транскрибирует 6 языков (EN/DE/F…
📅 01.07
4 модели
Claude Sonnet 5
закрытая агентная LLM от Anthropic, ставшая 1 июля моделью по умолчанию для планов Free и Pro и доступная в Max/Team/Enterprise; умеет планировать, использовать инструменты (браузер, терминал) и работать автономно, показывая 63,2% на agenti…
ABot-M0.5
vision-language-action (VLA, «зрение-язык-действие») мировая модель действий от команды AMAP CVLab (Alibaba) для мобильных роботов-манипуляторов…
VideoSearch-R1
агентная модель поиска и рассуждений по видео от исследователей Korea University (группа Hyunwoo J. Kim); обучена через RL-алгоритм GRPO с «мягким» уточнением запроса в латентном пространстве вместо переписывания текста, ставит SOTA на бенч…
DART / Domain Arithmetic
метод одношаговой (one-shot) адаптации VLA-моделей к смене окружения (ракурс камеры, другой робот — с Panda на UR5e) через арифметику весов и выравнивание сингулярных подпространств; от Taewook Kang и соавторов, превосходит существующие мет…
Июнь
2026
📅 27.06
1 модель
DeepSeek-V4-DSpark (Pro / Flash)
открытые ускоренные чекпоинты от DeepSeek AI на базе DeepSeek-V4: MoE-архитектура (Mixture of Experts) на 1.6T параметров (49B активных) с гибридным вниманием и контекстом 1M токенов…
📅 26.06
3 модели
GPT-5.6 Sol
закрытая флагманская мультимодальная модель OpenAI с новым уровнем reasoning-усилия «max» и режимом «ultra» (использует суб-агентов для сложных задач); доступ только через API в ограниченном превью (~20 организаций, по согласованию с правит…
GPT-5.6 Terra
сбалансированная закрытая модель OpenAI для повседневной работы: сопоставима по качеству с GPT-5.5, но примерно вдвое дешевле; API only, цена $2.50 / $15 за 1M токенов, старт в ограниченном превью с поэтапным расширением доступа (https://he…
GPT-5.6 Luna
самая быстрая и дешёвая модель линейки GPT-5.6 от OpenAI, рассчитана на высокообъёмные рутинные задачи; закрытый API, цена $1 / $6 за 1M токенов вход/выход, доступна пока только избранным партнёрам превью (https://help.openai.com/en/article…
📅 25.06
4 модели
Ornith-1.0
семейство открытых моделей для кодинга от DeepReinforce в четырёх размерах (9B и 31B dense, а также 35B и 397B на MoE-архитектуре (Mixture of Experts), ~3B активных у 35B); построено поверх Gemma 4 и Qwen 3.5, выдаёт reasoning в <think>-бло…
Gemini 3.5 Flash (Computer Use)
Google встроила управление компьютером напрямую в Gemini 3.5 Flash: модель видит экран и сама работает с браузером, ПК и мобильными устройствами для автотестов и офисной автоматизации…
ViQ
визуальный токенизатор от Tencent HY Vision Team (с Tsinghua, NTU, CAS) на 1.3B параметров на базе SigLIP2-g, преобразующий изображения любого разрешения в дискретные коды с сохранением семантики и качества реконструкции…
Qwen-Image-Agent
агентский фреймворк для генерации изображений от Alibaba Qwen: training-free, совместим с существующими генераторами, добавляет планирование, reasoning, веб/картиночный поиск и память для multi-image и multi-turn сценариев…
📅 23.06
4 модели
lift
открытая vision-модель на 9B параметров от Datalab для извлечения структурированного JSON из PDF и изображений по заданной JSON-схеме; использует schema-constrained decoding (декодирование с ограничением по грамматике), гарантирующее валидн…
OpenThoughts-Agent
открытые агентные модели на 8B и 32B параметров, дообученные от Qwen3 командой OpenThoughts (коллаборация институтов); натренированы по data-рецептам для агентных задач (исправление кода/SWE, работа с инструментами, терминал)…
Mistral OCR 4
закрытая модель document intelligence от Mistral AI; распознаёт документы (PDF, DOC, PPT, OpenDocument) на 170 языках, выдаёт структурированный JSON с bounding-box, классификацией блоков и оценками уверенности для RAG и enterprise-поиска…
Doubao 2.1 Pro
закрытая флагманская LLM от ByteDance, представленная на конференции Volcano Engine FORCE; крупное обновление с упором на кодинг, агентные сценарии и vision-language-понимание…
📅 22.06
3 модели
Sakana Fugu
оркестрационная модель от японской Sakana AI: 7B-«дирижёр», который сам маршрутизирует подзадачи по пулу фронтир-LLM через OpenAI-совместимый API; основана на работах TRINITY и Conductor (ICLR 2026)…
Sakana Fugu Ultra
усиленный вариант того же оркестратора, настроенный на максимальную точность в сложных многошаговых задачах (кодинг, рассуждения, наука); по заявлению Sakana, сравнивается с Claude Fable 5 и Mythos, не обучая ни одной собственной фронтир-мо…
gemma-4-12B-it-abliterix
abliterated (расцензуренная) дообученная версия Google Gemma 4 12B от автора wangzhang; dense-трансформер на 12B параметров в формате BF16 safetensors со снятым «выравниванием-отказом» для локального запуска…
📅 18.06
5 моделей
Sumi
открытая диффузионная языковая модель (Diffusion LM, uniform diffusion) на 7B параметров от Tohoku University; bidirectional Transformer на 36 слоёв, обучена на 1.5T токенов по фреймворку GIDD, полностью открыты веса, чекпойнты и рецепт обу…
PerceptionDLM
мультимодальная диффузионная языковая модель (Diffusion LM) на 9B от MSALab/PKU для одновременного описания нескольких областей изображения (image-text-to-text); генерирует подписи ко всем регионам за один проход денойзинга с ускорением до…
Moebius
сверхлёгкая диффузионная модель инпейнтинга изображений на 0.22B от Huazhong University of Science and Technology и VIVO AI Lab; латентный U-Net с блоками LλMI, латентность 26 мс/шаг и качество на уровне 10B-моделей (FLUX.1-Fill) при менее…
FreeStyle
диффузионный фреймворк генерации text-to-image с раздельными референсами стиля и контента от Fudan University, построен на майнинге community LoRA; сохраняет структуру и семантику контента, перенося стиль другого изображения; открыты веса…
S-Agent-8B
vision-language агент для пространственного рассуждения (spatial reasoning) от NTU, THU и ByteDance; VLM на 8B, дообученный из Qwen3-VL-8B на датасете S-300K, координирует иерархические 2D- и 3D-инструменты для подсчёта объектов, измерения…
📅 17.06
2 модели
MolmoMotion
открытая модель Ai2 (Allen Institute for AI) для language-guided 3D motion forecasting (предсказание 3D-траекторий точек по видеокадру и текстовой инструкции); использует Molmo 2 в качестве VLM-бэкбона, выложены веса, датасет MolmoMotion-1M…
MiniMax-M3 (технический отчёт MSA)
MiniMax опубликовал технический отчёт и inference-кёрнел архитектуры MSA (MiniMax Sparse Attention) под MIT-лицензией; натиивно мультимодальная MoE-модель на ~428B параметров (~23B активных) с 1M-контекстом, двухветвевая блочно-разреженная…
📅 16.06
4 модели
GLM-5.2
флагманская MoE-модель (Mixture of Experts) от Zhipu AI на 744B параметров (40B активных) с контекстом 1M токенов, ориентирована на длинные траектории кодинг-агентов; открытые веса под лицензией MIT, доступна через API ZAI/Novita/FriendliAI…
Qwen-RobotManip
VLA-модель (vision-language-action) от Alibaba Qwen на бэкбоне Qwen3.5-4B для манипуляции объектами роботизированными руками; обучена на 38 100+ часах данных манипуляции, код опубликован на GitHub в составе сюиты Qwen-RobotSuite (https://qw…
Qwen-RobotNav
навигационная VLA-модель от Alibaba Qwen на основе Qwen3-VL (варианты 2B/4B/8B), объединяющая следование инструкциям, point/target navigation и трекинг объектов; обучена на 15.6M примеров, latency 196 мс на Unitree Go2 с Jetson Thor (https:…
Qwen-RobotWorld
видео-«мировая модель» от Alibaba Qwen для предсказания будущих кадров сцены до действия робота; 60-слойная двухпоточная MMDiT-архитектура с замороженным энкодером Qwen2.5-VL на 20B параметров, опубликована в составе Qwen-RobotSuite (https:…
📅 13.06
2 модели
GLM-5.2
флагманская MoE-модель (Mixture of Experts) от Zhipu AI / Z.ai на 744B параметров (40B активных) с контекстом 1M токенов; 13 июня запущена на всех платных тарифах GLM Coding Plan (Lite / Pro / Max / Team), заточена под агентское программиро…
Count Anything
vision-модель подсчёта объектов по текстовому запросу от исследователей Tsinghua University (Mengqi Lei и соавторы); построена поверх Meta SAM3 с двумя счётчиками (Region-level Sparse Counter для крупных объектов, Pixel-level Dense Counter…
📅 12.06
3 модели
Kimi K2.7 Code
открытая coding-модель от Moonshot AI с MoE-архитектурой (Mixture of Experts): 1 триллион параметров всего, 32B активных, 384 эксперта, контекст 256K; заточена на длинные agentic-задачи в инженерии ПО, лицензия Modified MIT, веса на Hugging…
Zamba2-VL
семейство открытых vision-language моделей от Zyphra на 1.2B / 2.7B / 7B параметров с гибридной архитектурой Mamba2 (state-space) + Transformer; снижает time-to-first-token примерно на порядок против обычных VLM, лицензия Apache 2.0 (https:…
Gemini-SQL2
закрытая text-to-SQL модель Google Research поверх Gemini 3.1 Pro, переводит естественный язык в исполняемые SQL-запросы; первая система, преодолевшая 80% на бенчмарке BIRD (80.04%), без fine-tuning, рассчитана на интеграцию в BigQuery (htt…
📅 10.06
5 моделей
DiffusionGemma 26B-A4B
открытая MoE-модель (Mixture of Experts) от Google DeepMind на базе Gemma 4: 26B параметров (3.8B активных), диффузионная генерация текста параллельно вместо токен-за-токеном, контекст 256K, 140+ языков, Apache 2.0, ~1100 ток/с на H100 (htt…
Gemini 3.5 Live Translate
закрытая мультимодальная аудио-модель Google для синхронного голосового перевода с автоопределением языка на 70+ языков, доступ через Gemini API и приложение Gemini (https://blog.google/innovation-and-ai/models-and-research/gemini-models/ge…
i1
text-to-image (T2I) диффузионная модель на 3B параметров от Принстона, полностью открытый рецепт (веса, код и данные публичны), обучена на 300+ контролируемых экспериментах и конкурирует с проприетарными системами при тренировке только на п…
InternVideo3
мультимодальная видео-foundation модель от Shanghai AI Lab с архитектурой Multimodal Multi-head Latent Attention (M²LA) для длинного видео-контекста; вводит парадигму Multimodal Contextual Reasoning (MCR) и показывает SOTA на Video-MME, MLV…
DeNovoSWE-Agent
code-агент для генерации целых репозиториев из документации, fine-tuned на Qwen3-30B-A3B и Qwen3.5-35B-A3B; поднимает результат на BeyondSWE-Doc2Repo с 5.8% до 47.2%, датасет на 4818 инстансов и код открыты (https://huggingface.co/collectio…
📅 09.06
5 моделей
Claude Fable 5
закрытая флагманская модель Mythos-класса от Anthropic для самых сложных задач кодинга, vision и научных исследований; доступна через Claude API и Enterprise-планы по цене $10/$50 за 1M входных/выходных токенов (https://www.anthropic.com/ne…
Claude Mythos 5
та же базовая модель, что и Fable 5, но со снятыми защитными ограничениями; доступна узкой группе кибердефендеров и инфраструктурных провайдеров через Project Glasswing, цена та же ($10/$50 за 1M токенов) (https://www.anthropic.com/news/cla…
North Mini Code
открытая агентная coding-модель от Cohere на MoE-архитектуре (Mixture of Experts), 30B параметров (3B активных), контекст 256K и выход 64K; лицензия Apache 2.0, веса на HuggingFace, на Coding Index обгоняет Devstral Small 2 в 2.8× по throug…
Gemini 3.5 Live Translate
закрытая стриминговая speech-to-speech audio-модель от Google DeepMind для синхронного перевода между 70+ языками с сохранением тона и темпа; доступна в public preview через Gemini Live API и Google AI Studio, частный preview в Google Meet…
ABot-Earth 0.5
генеративная 3D-модель Земли от Alibaba AMap CV Lab, по одному спутниковому снимку или текстовому промту строит километровую городскую сцену в формате 3D Gaussian Splatting за ~10 минут на потребительском GPU; код открыт на GitHub, paper оп…
📅 08.06
4 модели
Xiaomi MiMo-V2.5-Pro-UltraSpeed
релиз Xiaomi совместно с TileRT: триллион-параметрическая MoE-модель (Mixture of Experts) с FP4-квантизацией и DFlash speculative decoding, преодолевшая отметку 1000+ токенов/с на стандартной 8-GPU-ноде; чекпойнт FP4-DFlash открыт на Huggin…
Nex-N2-Pro
агентная MoE-модель от Nex AGI на 397B параметров (17B активных) на базе Qwen3.5, мультимодальная (image-text-to-text), контекст 262K, лицензия Apache 2.0; 75.3 на Terminal-Bench 2.1 и 1585 на GDPval, конкурирует с GPT-5.5 и Claude Opus 4.7…
Nex-N2-Pro (free)
бесплатный облачный доступ к Nex-N2-Pro через OpenRouter с поддержкой reasoning, function calling и structured outputs, оптимизирован для кодинга, deep research и долгогоризонтных агентных задач (https://openrouter.ai/nex-agi/nex-n2-pro:fre…
Apple Siri (Gemini-powered)
обновлённый Siri от Apple, представленный на WWDC 2026: работает на кастомной 1.2T-параметрической модели Google Gemini в Private Cloud Compute, поддерживает on-screen awareness, persona context и Extensions (выбор ChatGPT/Gemini/Claude) (h…
📅 05.06
5 моделей
Gemma 4 E2B QAT
открытая мультимодальная (текст/изображение/аудио) модель от Google DeepMind, 2.3B эффективных параметров, 128K контекст; квантизация Q4_0 ужимает её до 3.2 ГБ, а новый мобильный формат — до ~1 ГБ для запуска на смартфонах, лицензия Gemma (…
Gemma 4 E4B QAT mobile
edge-вариант Gemma 4 на 4B параметров с мобильно-оптимизированным форматом (статические активации, channel-wise квантизация, 2-bit таргетное сжатие), занимает 5 ГБ в Q4_0 против 15 ГБ в BF16; готов к запуску через LiteRT-LM и MLX (https://h…
Gemma 4 12B QAT
instruction-tuned dense-модель Google на 12B параметров с QAT-квантизацией w4a16, рассчитана на потребительские GPU; поддерживает llama.cpp, Ollama, LM Studio, vLLM, лицензия Gemma (https://huggingface.co/google/gemma-4-12B-it-qat-w4a16-ct)
Gemma 4 26B-A4B QAT
MoE-архитектура (Mixture of Experts) Google DeepMind с 26B всего и 4B активных параметров на токен, QAT Q4_0 чекпойнт для эффективного локального инференса с компенсацией потерь точности на этапе обучения (https://huggingface.co/google/gemm…
Gemini Enterprise Agentic RAG
закрытая enterprise-система Google Research на базе Gemini для надёжного retrieval-augmented generation в корпоративных агентах; доступ только через Gemini Enterprise Agent Platform, без открытых весов (https://research.google/blog/unlockin…
📅 04.06
3 модели
Nemotron 3 Ultra
флагманская открытая модель NVIDIA на 550B параметров (55B активных) с гибридной MoE-архитектурой (Mixture of Experts) Mamba-Transformer, 108 слоёв и 512 экспертов; контекст 1M токенов, лицензия NVIDIA Open Model License, заточена под долго…
Nemotron 3.5 Content Safety
мультимодальный классификатор безопасности от NVIDIA на 4B параметров поверх Gemma 3 4B IT с LoRA-адаптерами и контекстом 128K; оценивает текст, изображения и ответы ассистента, поддерживает 12 языков нативно и ~140 в zero-shot, лицензия NV…
Grok Imagine Video 1.5
закрытая image-to-video модель xAI: анимирует статичные изображения в короткие ролики до 720p с сохранением освещения и деталей; управляется текстовыми промтами для камеры и темпа, доступна только в preview через xAI API (https://x.ai/news/…
📅 03.06
4 модели
Gemma 4 12B
открытая мультимодальная модель Google DeepMind на 12B параметров без визуального энкодера, нативно обрабатывает текст, изображения и аудио…
Cosmos 3
семейство foundation-моделей мира от NVIDIA в двух вариантах: Nano 16B (бэкбон Qwen3-VL 8B) и Super 64B (бэкбон Qwen3-VL 32B), архитектура two-tower MoT (Mixture of Transformers)…
Ideogram 4.0
открытая (open-weight) text-to-image (T2I) модель от Ideogram с нативным 2K-разрешением, bounding-box контролем размещения объектов и заметно улучшенным рендерингом текста…
Cosmos 3 paper
статья NVIDIA «Cosmos 3: Omnimodal World Models for Physical AI» на HuggingFace Papers, описывающая two-tower MoT-архитектуру и протоколы обучения для омнимодальных моделей мира; набрала ~8.7K апвоутов за день (https://huggingface.co/papers…
📅 02.06
6 моделей
MAI-Thinking-1
первая собственная reasoning-модель Microsoft: разреженная MoE-архитектура (Mixture of Experts) на ~1T параметров (35B активных) с контекстом 256K, обучена без дистилляции чужих моделей; сильна в математике (AIME 2026 — 94.5%) и кодинге, до…
MAI-Code-1-Flash
компактная кодинг-модель Microsoft на 5B параметров с адаптивным «мышлением» (экономит до 60% токенов на сложных задачах); закрытые веса, доступна в GitHub Copilot включая бесплатный тариф, по цене/качеству обходит Claude Haiku 4.5 (https:/…
MAI-Image-2.5
обновлённая модель Microsoft для генерации и редактирования изображений (text-to-image + image-to-image) с функциями «контроль с сохранением» деталей; дебютировала на 3-м месте Arena.ai среди image-моделей, доступ только через API в Microso…
MAI-Voice-2
многоязычная TTS-модель Microsoft (text-to-speech) с клонированием голоса и voice-prompting для более чем 15 языков, единый голос сохраняет идентичность между языками; закрытая, поставляется через Foundry и продукты Copilot/Bing (https://te…
MAI-Transcribe-1.5
модель распознавания речи (speech-to-text) от Microsoft на MoE-архитектуре, поддержка 43 языков и контекстного смещения терминологии; примерно в 5× быстрее конкурентов при цене $0.36/час, доступна только в облаке через Foundry (https://tech…
Holo3.1
семейство быстрых computer-use агентов (управление GUI на вебе, десктопе и мобильных) от H company в размерах 0.8B/4B/9B и 35B-A3B (MoE); открытые веса на HuggingFace с квантизациями FP8/NVFP4/Q4 GGUF для локального запуска, 79.3% на Androi…
📅 01.06
4 модели
MiniMax M3
открытая мультимодальная LLM от китайской MiniMax на разреженном внимании MSA (MiniMax Sparse Attention) с контекстом 1M токенов; нативно понимает изображения и видео, управляет компьютером и силён в агентном кодинге (59% SWE-Bench Pro, 70%…
Mellum2
компактная MoE-модель (Mixture of Experts) на 12B параметров (2.5B активных) от JetBrains для текста и кода; более чем в 2 раза быстрее моделей своего класса, заточена под маршрутизацию, RAG и саб-агентов, лицензия Apache 2.0 (https://huggi…
NVIDIA Cosmos 3
открытая omni-модель для физического ИИ от NVIDIA на архитектуре Mixture-of-Transformers; в едином трансформере объединяет генерацию мира, физический reasoning и генерацию действий (текст/изображение/видео/аудио/действия), версии Nano 16B и…
Nemotron 3 Ultra
открытая (open-weight) MoE-модель от NVIDIA на ~550B параметров (~55B активных), анонсирована 1 июня (выкладка весов 4 июня); сильнейшая открытая модель из США по Artificial Analysis (48 баллов) и >300 токенов/с на DeepInfra (https://the-de…
Май
2026
📅 29.05
5 моделей
Step 3.7 Flash
открытая vision-language MoE-модель (MoE — Mixture of Experts, разреженная архитектура экспертов) на 198B параметров (~11B активных) с контекстом 256k от StepFun; ориентирована на агентов для кодинга и веб-поиска (56,26% на SWE-Bench Pro)…
Qwen-VLA
vision-language-action модель (зрение-язык-действие) от Alibaba Qwen для управления роботами разных конфигураций; использует DiT-декодер действий (Diffusion Transformer) и единый фреймворк для манипуляций и навигации, 97,9% на бенчмарке LIB…
minWM
открытый full-stack фреймворк от ShengShu и университетов Tsinghua/RUC для real-time интерактивных видео-world-моделей; дистиллирует диффузионные бэкбоны Wan2.1-1.3B и HY1.5-8B в few-step (малошаговые) авторегрессионные генераторы, ускоряя…
NAVA
модель на 6.3B параметров от ERNIE Team (Baidu) для совместной генерации аудио и видео; архитектура Align-then-Fuse MMDiT обеспечивает точную аудио-видео синхронизацию и управляемый тембр речи, веса и код открыты на HuggingFace (https://hug…
GPT-Rosalind
закрытая облачная модель OpenAI для наук о жизни (рассуждения о молекулах, белках, генах, биологии болезней); 29 мая OpenAI расширила бесплатный доступ через программу Rosalind Biodefense для проверенных команд и госпартнёров (вакцины, скри…
📅 28.05
10 моделей
RightNow-Arabic-0.5B-Turbo
арабоязычная LLM на 518M параметров на базе Qwen2.5-0.5B, полные веса (bf16/int8/GGUF), код и бенчмарки выложены на Hugging Face (arXiv cs.CL)
Liquid AI LFM2.5-8B-A1B
MoE-модель с 8.3B общих и 1.5B активных параметров, оптимизирована для on-device-инференса
Perplexity Unigram Tokenizer
переписанный с нуля open-source токенизатор, снижает латентность реранкеров и CPU-нагрузку в 5–6×
minWM
полностековый open-source фреймворк для интерактивных видео-«world models» в реальном времени
Qwen-VLA
унифицированная vision-language-action модель от команды Qwen для роботов и разных окружений
MOSS-TTS
открытое семейство моделей для генерации речи и звуков, включая диалоги и звуковые эффекты
Parallax
параметризованное локальное линейное внимание для языкового моделирования от Northwestern University
GenClaw
code-driven агентная генерация изображений от Tencent Hunyuan
LiteCoder-Terminal
масштабирование long-horizon terminal-окружений для обучения языковых агентов
PhoneWorld
масштабируемая среда для агентов, использующих смартфон
📅 27.05
15 моделей
DiffusionBlocks
фреймворк блочного обучения от Sakana AI, превращает остаточные сети в независимо обучаемые денойзинг-модули
Polar
NVIDIA выпустила token-faithful rollout-фреймворк для GRPO-тренировки поверх Codex, Claude Code и Qwen Code
EAGLE 3.1
алгоритм спекулятивного декодинга, борющийся с attention drift; совместный релиз EAGLE team, vLLM и TorchSpec
Gamma-World
генеративная модель мульти-агентного мира от NVIDIA, выходящая за рамки игр на двух игроков
From Pixels to Words
натив-визуальная модель на масштабе с архитектурой one-vision
Agent Explorative Policy Optimization
NVIDIA, оптимизация политики для мультимодального агентного рассуждения
OSP-Next
эффективная высококачественная модель генерации видео от Peking University
HRBench
Tencent, бенчмарк стратегий переключения режимов мышления в гибридно-рассуждающих LLM
OmniVerifier-M1
мультимодальный мета-верификатор со структурированной рекалибровкой
ResearchMath-14K
Seoul National University, агентное масштабирование математики исследовательского уровня
Self-Improving LM with Bidirectional Evolutionary Search
Harvard, самоулучшающиеся языковые модели через двунаправленный эволюционный поиск
AutoScientists
Harvard, самоорганизующиеся команды агентов для научных экспериментов
ITBench-AA
IBM × Artificial Analysis, первый бенчмарк для агентных задач корпоративного IT (фронтир-модели набирают <50%)
Reachy Mini goes fully local
open-source стек локального голосового робота от Pollen Robotics / Hugging Face
FLUID
фреймворк адаптации AR-бэкбонов к диффузионным моделям для параллельной генерации текста (arXiv cs.CL)
📅 26.05
10 моделей
OmniVoice Studio
локальная open-source альтернатива ElevenLabs: клонирование голоса, дубляж видео, диктовка и диаризация спикеров, поддержка 646 языков и встроенный MCP-сервер
Stable Audio 3
семейство быстрых latent-diffusion моделей для генерации и редактирования аудио (Small SFX 459M, Small 459M, Medium 1.4B с открытыми весами); генерация композиций до 6 мин 20 сек
LocateAnything
модель NVIDIA для vision-language grounding с параллельным декодированием bounding-боксов
MobileMoE
оптимизированная on-device Mixture-of-Experts модель от Meta AI для запуска на мобильных устройствах
MUSE-Autoskill
фреймворк самоэволюционирующих агентов ByteDance с автономным созданием навыков, памятью и оценкой
RT-Lynx
диффузионная модель от RTP-LLM с правильной GEMM-разрежённостью для ускорения инференса
MRT (Masked Region Transformer)
трансформер для послойной генерации и редактирования изображений в большом масштабе
Soap2Soap
мультиагентная система Show Lab для пересборки длинных кинематографических видео
Geometry-Aware Representation Denoising
модель KAIST AI для устойчивой multi-view 3D-реконструкции через денойзинг геометрических представлений
Squeezing Capacity from MLLMs
методы Adobe для эффективной subject-driven генерации на базе мультимодальных LLM
📅 25.05
6 моделей
Raon-Speech
9B-параметровая речевая языковая модель для английского и корейского с публичными чекпоинтами и обучающим пайплайном (arxiv cs.CL)
QUEST
семейство открытых моделей 2B–35B в роли универсальных агентов для глубоких исследований; выложены веса, данные и скрипты обучения (arxiv cs.CL)
EchoDistill
open-source фреймворк выравнивания для аудио-LLM, повышающий устойчивость к шуму; код в анонимном репозитории (arxiv cs.CL)
ContextEcho
открытый бенчмарк и харнесс для измерения дрейфа персоны в длинных агентских сессиях кодинга (arxiv cs.CL)
CP-Agent
агент с калиброванным контролем риска для соревновательного программирования; код на GitHub (arxiv cs.CL)
OSCAR
attention-aware система 2-битной квантизации KV-кэша для long-context инференса LLM от Together AI (together.ai)