Автор разобрал, какие типы вычислений важны для LLM, и выяснил, почему его кластер на CMP90HX работал хуже ожидаемого: вычислительная мощность на этих задачах была искусственно ограничена. В материале описана китайская модификация, снимающая ограничение; после проверки на практике зафиксирован реальный прирост производительности почти в два раза.

Для домашних и малых кластеров LLM узкое место часто скрывается не в «сырой» мощности GPU, а в прошивках и лимитах, которые режут нужный класс операций. Публикация показывает путь от диагностики типов нагрузки до сравнения результатов до и после модификации — с опорой на измерения, а не на заявления производителя.

Практический вывод для владельцев похожего железа: перед апгрейдом стоит проверить, не упирается ли система в программные ограничения, и только потом менять конфигурацию. Имеет смысл повторить бенчмарки на своих моделях и сравнить цифры с опубликованными, прежде чем повторять модификацию.