320м моделька с 4к контекстом батчсайз 6 претрен на 8гб данных (очень мало, но столько выкачано да и для прицела пойдет) должно хватить 30 часов на 2x3090 лучше наверное не будет да и закругляться пора. вроде бы все оптимизации засунуты какие можно было если со временем еще будет что-то обновляться выходить можно будет затаскивать щас все это дело тестить на всех стадиях ну и в мейн других дополнений и того что надо еще в студии сделать дофига
320м моделька с 4к контекстом батчсайз 6 претрен на 8гб данных (очень мало, но…
0 viewsОткрыть в Telegram →
Из этого канала
- #5619Ищем в команду сильного fullstack 🔨 или бэкенд и фронтенд Что важно по навыкам:…
Ищем в команду сильного fullstack 🔨 или бэкенд и фронтенд Что важно по навыкам: + уверенный backend (Python / Node / или Go / API / работа с LLM, RAG ) + или…
- #5622у нас есть grpo, dr.grpo и dapo по-дефолту будет grpo все же
у нас есть grpo, dr.grpo и dapo по-дефолту будет grpo все же
- #5623On neural scaling and the quanta hypothesis https://ericjmichaud.com/quanta/
On neural scaling and the quanta hypothesis https://ericjmichaud.com/quanta/
- #5617добавляю лигеркернелы в претрен наших собственных моделек щас там 7гб врам…
добавляю лигеркернелы в претрен наших собственных моделек щас там 7гб врам используется было 11 пока хорошо, но надо проверять)
- #5614лигер кернелы в процессе. частично добавлено в grpo. раньше тут память…
лигер кернелы в процессе. частично добавлено в grpo. раньше тут память долбилась в потолок, то есть всегда почти была 22-23гб, щас сильно поменьше.