Paradigma 开源 Limite 1B Violetto,2026-09-21 发布。远超 1.5B / 2B / 3B / 4B / 9B 模型,比肩qwen3.5-27b。
从零训练,语料不到 300B token,高度精筛 + 合成数据 + SFT + RL。
• 48 层 / hidden 1280 / 10 头 2 KV 头 / head_dim 128
• 滑窗 1024 + 每 4 层插一层 global NoPE
• 价值嵌入(value_embeds)、注意力门(attn_gate)、XSA
• 可学习残差系数(resid_lambda_* / post_lambda_*)、稠密残差混合(mudd)
• sigmoid logit softcap、rope_base 只有 1024、交错配对 + 奇位翻号
• 词表 262144、上下文 131072
