Я решил проверить, как далеко можно зайти, если обучать скрытый слой нейросети вообще без обратного распространения ошибки. Только локальными правилами: каждый нейрон видит свой вход, свою активность и что делают соседи, и все. Никакого глобального сигнала ошибки и никаких меток.
Спойлер: в моей постановке такое обучение в итоге свелось к обычному k‑means. Оно обгоняет k‑means с той же архитектурой максимум на полпроцента и ни в чем не обгоняет backprop: ни по точности, ни при малом числе меток, ни по забыванию.
