- GPU0%
BlockBeats News, 8 августа, разработчик недавно опубликовал с открытым исходным кодом проект kimi-k3-in-c, в котором предпринята попытка запустить модель Kimi K3 с 2,78 трлн параметров на устройстве всего с 8 ГБ оперативной памяти. Размер проекта составляет всего 176 КБ, он написан на чистом C99, не полагается на GPU, CUDA, PyTorch или BLAS и может выполнять инференс модели исключительно с помощью CPU.
Это решение использует архитектуру MoE (Mixture of Experts — смесь экспертов) модели Kimi K3. Хотя общий размер параметров модели достигает 2,78 трлн, в каждом слое активируются только 16 из 896 экспертов. Поэтому разработчик не стал загружать в память все веса модели объемом около 1,56 ТБ. Вместо этого большая часть весов экспертов хранится на NVMe-накопителе и динамически считывается в зависимости от требований инференса. Кроме того, некоторые плотные магистральные слои также используют метод послойной потоковой загрузки.
Однако в настоящее время это решение имеет существенные ограничения по производительности. В режиме 8 ГБ оперативной памяти генерация одного токена занимает около 32,7 с, при этом требуется поддержка высокоскоростного хранилища объемом почти 1,7 ТБ.
Разработчик заявил, что этот подход в настоящее время больше похож на экспериментальное исследование оптимизации инфраструктуры инференса больших моделей и не имеет практической производственной ценности. Тем не менее, благодаря подходу «потоковая загрузка с диска + разреженная активация MoE» он предлагает новую идею для запуска сверхкрупномасштабных моделей с низкими затратами в будущем.
Отказ от ответственности: текущее содержание основано на мнениях третьих лиц или напрямую переведено искусственным интеллектом из сторонних источников. Мы не гарантируем его подлинность, точность или оригинальность, а также эта информация не содержит инвестиционных рекомендаций со стороны CoinEx. Криптоактивы подвержены сильной волатильности, поэтому всегда учитывайте потенциальные риски.
- МонетыЦенаИзм. за 24 ч.