Damus
Digitual 🐒 · 3w
Тут давеча Греф на голубом глазу взял и раскрыл базу) Сказал, что нейросеть от Яндекса это обученный qwen) Прики...
D:\side\>:idle: profile picture
@nprofile1q... если это про "дистилляцию", то:
(1) В чём зависимость-то заключается? Для этого всё ещё надо скачать веса и дотренировать модельку, чтобы получить свою, и инференс по ней делается на своём железе, авторы Квена в этом уже не участвуют.
(2) Китайские вендоры поменьше Алибабы тоже таким развлекаются: https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks – и местами получалось очень мощно. Помнишь, как в начале 2025 NVidia потеряла $500B капитализации с выходом DeepSeek R1, первой массовой "размышляющей" моделью? Эти тоже свои модели тренировали далеко не с нуля, а дорабатывали, в разных весовых категориях, Qwen (Alibaba) и Llama (Meta).

С выводом не спорю, но путь к нему – херня :blobcatwinktongue:
1
Digitual 🐒 · 3w
nostr:nprofile1qy2hwumn8ghj7un9d3shjtnyd968gmewwp6kyqpqq2ge3rhqrsn3s5q5cz7agfxz6yl8tkyw9uemzqlwt62ua0j7umxske089c я тоже люблю китайские модели, возможно, я не раскрыл слово суверенность в контексте. Яндекс обучит qwen...