гигабитный Ethernet. Тестировались модели Llama-3.2-1B-Instruct, Llama-3.1-8B-Instruct, Qwen2.5-32B-Instruct (все в квантовании Q4_K_M) и gpt-oss-20b (MoE). Для модели на 1B параметров кластер (i3+i5) показал 22,5 токена в секунду (ток/с) при генерации против 29,2 ток/с на лучшем одиночном узле (i3), что на 23% медленнее. Для модели на 8B параметров кластер почти сравнялся с одиночным узлом (4,6 против 4,9 ток/с), но обработка промптов была почти в 3 раза быстрее (10,9 против 3,9 ток/с). Для модели на 32B параметров, которая не помещалась ни в один узел, кластер достиг 1,1 ток/с против 0,3 ток/с на узле с подкачкой, что на 268% лучше. С моделью MoE gpt-oss-20b, которая также не помещалась на одном узле, кластер показал стабильные 8,0-8,1 ток/с при генерации и 15,4-15,9 ток/с при оценке промпта, по сравнению с нестабильной производительностью одиночного узла. Вывод: распределённый инференс оправдан только тогда, когда модель не помещается в один узел; в противном случае лучше использовать один быстрый узел. Кроме того, обработка промптов выигрывает от параллелизма, а генерация токенов — нет, и любой слабый узел может стать узким местом кластера.