Ребята сделали крутую обзорку механизмов знаний в ллмковых. Обязательно сохраняем! Я вообще очень люблю обзорки, ведь муторно все время следить за самыми новыми статьями в какой-то области. Тут все в одном Начинают с определения знаний в ллмках, потом архитектура нашего любимого трансформера, методы анализа знаний, как знания в ллмках используются, как создаются, про меморизацию и тд. И главное на все ссылочки Попутно авторы выделили 5 гипотез: Hypothesis 1: Modular Region Knowledge is Encoded in Modular Region Hypothesis 2: Connection Knowledge is Represented by Connections. Hypothesis 3: Reuse LLMs Reuse Certain Components during Knowledge Comprehension and Application. Hypothesis 4: Extrapolation LLMs May Create Knowledge via Extrapolation. Hypothesis 5: Dynamic Intelligence Conflict and Integration Coexist in the Dynamic Knowledge Evolution of LLMs. По каждому разделу можно кучу отдельных постов писать но это позже Knowledge Mechanisms in Large Language Models: A Survey and Perspective https://arxiv.org/abs/2407.15017
Ребята сделали крутую обзорку механизмов знаний в ллмковых. Обязательно…
Из этого канала
- #5614лигер кернелы в процессе. частично добавлено в grpo. раньше тут память…
лигер кернелы в процессе. частично добавлено в grpo. раньше тут память долбилась в потолок, то есть всегда почти была 22-23гб, щас сильно поменьше.
- #5617добавляю лигеркернелы в претрен наших собственных моделек щас там 7гб врам…
добавляю лигеркернелы в претрен наших собственных моделек щас там 7гб врам используется было 11 пока хорошо, но надо проверять)
- #5618320м моделька с 4к контекстом батчсайз 6 претрен на 8гб данных (очень мало, но…
320м моделька с 4к контекстом батчсайз 6 претрен на 8гб данных (очень мало, но столько выкачано да и для прицела пойдет) должно хватить 30 часов на 2x3090…
- #5611а я времени зря не теряю вот сейчас ресерчит мне
а я времени зря не теряю вот сейчас ресерчит мне
- #5610я даже хз, если видел, то чот не отобразил себе
я даже хз, если видел, то чот не отобразил себе