Инференс и железо
NVIDIA представила процессор Vera для ускорения агентных ИИ-систем
NVIDIA анонсировала процессор Vera, оснащенный ядрами Olympus, спроектированными для обеспечения максимальной производительности в однопоточных вычислениях. Архитектура ориентирована на нужды агентного ИИ, где критические задачи — запуск кода в песочницах, вызов инструментов и обработка контекста — ложатся на центральный процессор, требуя высокой скорости отклика и эффективной работы с логикой выполнения.
Архитектура NVIDIA Rubin: новое поколение GPU для агентного ИИ
NVIDIA представила архитектуру Rubin, спроектированную для поддержки масштабных систем агентного ИИ. Новое поколение GPU ориентировано на работу «всегда включенных» интеллектуальных фабрик, требующих высокой пропускной способности памяти и энергоэффективности. Архитектура призвана ускорить инференс и обучение моделей, которые переходят от простых чат-интерфейсов к автономному выполнению сложных задач в режиме реального времени.
Рекорд обучения MoE-моделей на архитектуре NVIDIA GB200 NVL72
NVIDIA продемонстрировала возможности своей новой вычислительной платформы GB200 NVL72, установив рекорд эффективности при обучении Mixture-of-Experts (MoE) моделей. Использование специализированного оборудования позволило значительно ускорить процесс обработки токенов и оптимизировать распределение вычислительных ресурсов, что становится критически важным фактором для масштабирования современных frontier-моделей и преодоления ограничений традиционных архитектур обучения.
Nativ: запуск локальных LLM на macOS с поддержкой MLX
Разработчик Принс Канума представил Nativ — новое десктопное приложение для macOS, позволяющее запускать локальные языковые модели с использованием фреймворка MLX от Apple. Инструмент предоставляет пользователям графический интерфейс для общения с моделями и локальный API-сервер, обеспечивая интеграцию с другими приложениями. Решение ориентировано на эффективное использование аппаратных мощностей чипов Apple Silicon для работы с ИИ.
Microsoft расширяет инфраструктуру ИИ за счет кластеров на базе AMD
Microsoft переходит к диверсификации вычислительных мощностей для своих облачных сервисов Azure, заключая стратегическое партнерство с AMD. Компания начинает масштабное развертывание кластеров, объединяющих процессоры EPYC и графические ускорители Instinct MI300X. Этот шаг направлен на снижение зависимости от единственного поставщика оборудования и удовлетворение растущего спроса на высокопроизводительные вычисления для обучения и инференса нейросетей.
Роль материаловедения в развитии аппаратной базы для ИИ
Развитие ИИ упирается не только в алгоритмы и инвестиции в дата-центры, но и в фундаментальные инновации в области материаловедения. Новое поколение нейросетей требует кратного увеличения вычислительной мощности, плотности памяти и энергоэффективности. Достижение этих показателей невозможно без создания принципиально новых полупроводниковых материалов, способных работать при экстремальных нагрузках и тепловыделении, характерных для современных ускорителей.
Китайская Z.ai запустила дата-центр мощностью 1 ГВт на базе локальных чипов
Китайская компания Z.ai завершила строительство вычислительного центра мощностью 1 гигаватт, полностью укомплектованного оборудованием отечественного производства. Проект демонстрирует способность китайской индустрии масштабировать ИИ-инфраструктуру в условиях экспортных ограничений на передовые западные полупроводники. Это один из крупнейших объектов такого класса, ориентированный на обучение и поддержку работы масштабных языковых моделей с использованием исключительно локальных аппаратных решений.
NVIDIA представила Cosmos 3 Edge: компактную модель для локального управления роботами
NVIDIA выпустила Cosmos 3 Edge — специализированную модель с 4 миллиардами параметров, оптимизированную для работы непосредственно на периферийных устройствах. Решение позволяет роботам и визуальным ИИ-агентам анализировать окружающую среду, выполнять логические операции в реальном времени и генерировать последовательности действий без необходимости обращения к облачным серверам, что критически важно для автономных систем.
Google разрабатывает новый чип для оптимизации работы моделей Gemini
Google планирует выпустить новое поколение специализированных процессоров для ускорения работы своих нейросетевых моделей Gemini. Разработка направлена на повышение энергоэффективности и снижение затрат на инференс при выполнении сложных вычислительных задач. Ожидается, что внедрение собственного «железа» позволит компании сократить зависимость от сторонних поставщиков и оптимизировать инфраструктуру для масштабируемых ИИ-сервисов к 2026 году.
Проект Colibrì: запуск моделей весом 1.5 ТБ на 25 ГБ оперативной памяти
Исследователи представили концепт Colibrì, позволяющий запускать массивные ИИ-модели объемом 1.5 ТБ на потребительском оборудовании с 25 ГБ оперативной памяти. Метод радикально снижает требования к VRAM и RAM за счет оптимизации доступа к данным, открывая путь к локальному использованию моделей «фронтирного» уровня без необходимости в дорогостоящих серверных кластерах с десятками GPU.
Jan: open-source платформа для локального запуска LLM
Jan — это open-source платформа, позволяющая запускать большие языковые модели локально на персональных компьютерах без необходимости подключения к облачным API. Инструмент предоставляет графический интерфейс для взаимодействия с моделями, обеспечивая приватность данных и независимость от сторонних провайдеров. Платформа поддерживает работу с различными архитектурами моделей, включая Llama, Mistral и другие популярные решения с открытым исходным кодом.
Google разрабатывает специализированный чип с аппаратной интеграцией Gemini
Google работает над созданием специализированного процессора, в архитектуру которого на уровне кремния интегрированы функции модели Gemini. Это решение направлено на оптимизацию выполнения ИИ-задач непосредственно на устройстве, что позволит значительно повысить скорость обработки данных и энергоэффективность по сравнению с традиционными программными методами запуска нейросетей на стандартных мобильных чипах.
Новый ML-компилятор для запуска LLM 70B+ на потребительских GPU
Разработчики представили специализированный ML-компилятор, позволяющий запускать крупномасштабные языковые модели с параметрами 70B+ на обычном потребительском оборудовании. Технология оптимизирует процесс вычислений таким образом, что потеря точности модели составляет менее 1%, что делает возможным эффективное использование мощных нейросетей вне серверных кластеров и профессиональных вычислительных центров.
Google разрабатывает специализированный чип для оптимизации работы моделей Gemini
Google ведет разработку нового специализированного процессора, предназначенного для повышения эффективности работы нейросетей семейства Gemini. Проект направлен на оптимизацию инференса, что позволит компании снизить вычислительные затраты и ускорить обработку запросов в своих облачных сервисах. Новое аппаратное решение должно укрепить позиции Google в конкуренции с производителями специализированных ускорителей для обучения и запуска масштабных ИИ-моделей.
Z.ai запустила дата-центр на китайских чипах для обучения ИИ
Компания Z.ai завершила строительство крупного вычислительного центра, полностью оснащенного китайскими графическими процессорами. Этот шаг стал ответом на экспортные ограничения США, вынуждающие технологические компании искать альтернативы продукции NVIDIA. Проект демонстрирует возможность масштабирования обучения нейросетей на альтернативном «железе» в условиях глобального дефицита передовых полупроводников и санкционного давления на полупроводниковую отрасль.
Локальное детектирование ИИ-текста на iPhone с помощью Gemma
Команда Imbue представила Bouncer — инструмент для локального обнаружения сгенерированного ИИ контента, работающий непосредственно на iPhone. Решение использует квантованную модель Gemma от Google, обеспечивая приватность и независимость от облачных API. Это демонстрирует возможность запуска эффективных классификаторов на мобильных устройствах без передачи пользовательских данных на внешние серверы для анализа.
Nativ: локальный запуск и управление MLX-моделями на macOS
Nativ — это новое macOS-приложение для локальной работы с моделями машинного обучения, оптимизированными под архитектуру Apple Silicon через фреймворк MLX. Инструмент объединяет функции чат-интерфейса, локального сервера для обслуживания моделей, мониторинга ресурсов и управления подключениями, позволяя разработчикам запускать LLM непосредственно на своем устройстве без обращения к облачным API.
Google разрабатывает чип Frozen v2 для аппаратного ускорения архитектуры Gemini
Google работает над созданием специализированного серверного процессора Frozen v2, который переносит архитектуру нейросети Gemini непосредственно на уровень «железа». Ожидается, что интеграция алгоритмов в кремний обеспечит прирост энергоэффективности в 6–10 раз по сравнению с текущими тензорными процессорами (TPU). Запуск проекта запланирован на 2028 год, что позволит компании существенно снизить затраты на инференс.
Microsoft и Anthropic диверсифицируют инфраструктуру, переходя на чипы AMD
Microsoft расширяет вычислительные мощности облака Azure за счет внедрения платформы AMD Helios, которая должна составить конкуренцию решениям Nvidia во второй половине 2026 года. Параллельно с этим появились свидетельства того, что компания Anthropic начала тестирование оборудования AMD для своих моделей. Эти шаги сигнализируют о постепенном снижении зависимости рынка от доминирования Nvidia в сегменте ИИ-чипов.
Адаптация моделей на устройствах с помощью ускорителя Hailo-8L
Исследователи представили метод адаптации нейросетей непосредственно на периферийных устройствах, преодолевающий ограничения памяти и вычислительной мощности. Используя ускоритель Hailo-8L, авторы реализовали гетерогенный конвейер, который позволяет дообучать модели без необходимости полного обратного распространения ошибки. Это решение открывает путь к эффективной персонализации ИИ-систем на локальном оборудовании с минимальным энергопотреблением и высокой скоростью отклика.
NVIDIA NVLink: масштабируемая архитектура для обучения и инференса ИИ
NVIDIA представила подробный обзор технологии NVLink, которая служит фундаментом для создания высокопроизводительных вычислительных кластеров. Архитектура обеспечивает сверхбыструю передачу данных между графическими процессорами, позволяя объединять тысячи GPU в единую вычислительную систему. Это критически важное решение для обучения масштабных моделей и выполнения сложных задач инференса, требующих минимальных задержек при обмене данными между узлами.
Основы инференса ИИ-моделей на языке Go
Статья разбирает фундаментальные принципы работы инференса нейросетей, фокусируясь на реализации процесса на языке Go. Автор объясняет переход от обучения модели к этапу предсказания, затрагивая математические операции, такие как матричное умножение, и роль весов модели. Материал помогает понять, как именно программный код взаимодействует с архитектурой нейросети для получения результата.
TSMC ускоряет строительство заводов в Аризоне из-за спроса на ИИ-чипы
Компания TSMC форсирует запуск производственных мощностей в Аризоне, чтобы удовлетворить взрывной спрос на полупроводники для систем искусственного интеллекта. Масштабирование площадок в США призвано диверсифицировать цепочки поставок и обеспечить бесперебойный выпуск передовых чипов, необходимых для обучения и инференса крупнейших нейросетевых моделей, которые требуют колоссальных вычислительных ресурсов и специализированного оборудования.
Выпущена компактная модель с поддержкой рассуждений весом 657 МБ
Разработчик представил дообученную версию модели MiniCPM5-1B, которая демонстрирует способности к логическому мышлению, имитируя поведение Claude Fable 5. Модель весит всего 657 МБ и поддерживает контекстное окно до 128 тысяч токенов. Это решение позволяет запускать полноценные агентные рассуждения локально на устройствах с крайне ограниченными вычислительными ресурсами, сохраняя при этом высокую эффективность инференса.