Привет! А можно здесь дать на пробу свою либу? У Apple есть статья, как параллелить обучение RNN. Я написал реализацию с Triton и на своих 2080 Ti и 3060 действительно получил ускорение на порядки. Я вроде с ГоПоТой всё вылизал, но хочется обратной связи от реальных людей. pip install pararnn-torch https://github.com/bugkira/pararnn-torch