කොරියානු AI සමාගමක් අලුතින්ම 314B MoE model එකක් එළියට දාලා තියෙනවා. මේක 13B active parameters වලින් වැඩ කරනවා වගේම, MiniMax M3 සහ DeepSeek v4 Pro එක්ක benchmarks වලින් කරට කර තරග කරනවා.
මේකේ 384 experts ඉන්නවා වගේම, එක token එකකට 8 activated වෙනවා. ඒ වගේම මේක natively 256K context window එකක් support කරනවා. අනිත් විශේෂම දේ තමයි මේක වෙනත් කිසිම existing architecture එකක re-parameterization එකක් නෙවෙයි.
සම්පූර්ණයෙන්ම එයාලගෙම පර්යේෂණ මත පදනම් වෙලා හදපු මේ fully proprietary architecture එකට polynorm activation, gated differential latent attention සහ modified mHC කියන දේවල් පාවිච්චි කරලා තියෙනවා. Motif-3 කියලා හඳුන්වන මේකේ දැනට එළියට ඇවිත් තියෙන්නේ beta checkpoint එක විතරයි.
මේකෙන් පැහැදිලිවම පේන දේ තමයි open weight frontier models කියන්නේ තවත් ඇමරිකාවට සහ චීනයට විතරක් සීමා වෙච්ච දෙයක් නෙවෙයි කියන එක. මේ ගැන ඔයා මොකද හිතන්නේ? පහළින් කමෙන්ට් කරන්න.
උපුටා ගැනීම : Shalinda Jayasinghe
