InklingForConditionalGeneration(
(model): InklingModel(
(language_model): InklingTextModel(
(embed_tokens): Embedding(201024, 8)
(layers): ModuleList(
(0): InklingDecoderLayer(
(self_attn): InklingAttention(
(q_proj): Linear(in_features=8, out_features=256, bias=False)
(k_proj): Linear(in_features=8, out_features=128, bias=False)
(v_proj): Linear(in_features=8, out_features=128, bias=False)
(r_proj): Linear(in_features=8, out_features=128, bias=False)
(o_proj): Linear(in_features=256, out_features=8, bias=False)
(k_sconv): InklingShortConvolution(
(conv1d): Conv1d(128, 128, kernel_size=(4,), stride=(1,), padding=(3,), groups=128, bias=False)
)
(v_sconv): InklingShortConvolution(
(conv1d): Conv1d(128, 128, kernel_size=(4,), stride=(1,), padding=(3,), groups=128, bias=False)
)
(q_norm): InklingRMSNorm((32,), eps=1e-06)
(k_norm): InklingRMSNorm((32,), eps=1e-06)
(rel_logits_proj): InklingRelativeLogits()
)
(mlp): InklingMLP(
(gate_proj): Linear(in_features=8, out_features=32, bias=False)
(up_proj): Linear(in_features=8, out_features=32, bias=False)
(down_proj): Linear(in_features=32, out_features=8, bias=False)
(act_fn): SiLUActivation()
)
(input_layernorm): InklingRMSNorm((8,), eps=1e-06)
(post_attention_layernorm): InklingRMSNorm((8,), eps=1e-06)
(attn_sconv): InklingShortConvolution(
(conv1d): Conv1d(8, 8, kernel_size=(4,), stride=(1,), padding=(3,), groups=8, bias=False)
)
(mlp_sconv): InklingShortConvolution(
(conv1d): Conv1d(8, 8, kernel_size=(4,), stride=(1,), padding=(3,), groups=8, bias=False)
)
)
(1): InklingDecoderLayer(
(self_attn): InklingAttention(
(q_proj): Linear(in_features=8, out_features=256, bias=False)
(k_proj): Linear(in_features=8, out_features=128, bias=False)
(v_proj): Linear(in_features=8, out_features=128, bias=False)
(r_proj): Linear(in_features=8, out_features=128, bias=False)
(o_proj): Linear(in_features=256, out_features=8, bias=False)
(k_sconv): InklingShortConvolution(
(conv1d): Conv1d(128, 128, kernel_size=(4,), stride=(1,), padding=(3,), groups=128, bias=False)
)
(v_sconv): InklingShortConvolution(
(conv1d): Conv1d(128, 128, kernel_size=(4,), stride=(1,), padding=(3,), groups=128, bias=False)
)
(q_norm): InklingRMSNorm((32,), eps=1e-06)
(k_norm): InklingRMSNorm((32,), eps=1e-06)
(rel_logits_proj): InklingRelativeLogits()
)
(mlp): InklingMoE(
(gate): InklingTopkRouter()
(experts): InklingExperts(
(act_fn): SiLUActivation()
)
(shared_experts): InklingSharedExperts(
(act_fn): SiLUActivation()
)
)
(input_layernorm): InklingRMSNorm((8,), eps=1e-06)
(post_attention_layernorm): InklingRMSNorm((8,), eps=1e-06)
(attn_sconv): InklingShortConvolution(
(conv1d): Conv1d(8, 8, kernel_size=(4,), stride=(1,), padding=(3,), groups=8, bias=False)
)
(mlp_sconv): InklingShortConvolution(
(conv1d): Conv1d(8, 8, kernel_size=(4,), stride=(1,), padding=(3,), groups=8, bias=False)
)
)
)
(norm): InklingRMSNorm((8,), eps=1e-06)
(embed_norm): InklingRMSNorm((8,), eps=1e-06)
)
(audio_tower): InklingAudioModel(
(embed_audio_tokens): InklingAudioModelEmbeddings(
(embed_audio_tokens): Embedding(1280, 8)
)
(norm): InklingRMSNorm((8,), eps=1e-06)
)
(vision_tower): InklingVisionModel(
(encoder_layers): ModuleList(
(0): InklingVisionEncoderLayer(
(projection): Linear(in_features=300, out_features=320, bias=False)
(layer_norm): InklingRMSNorm((320,), eps=1e-06)
)
(1): InklingVisionEncoderLayer(
(projection): Linear(in_features=10240, out_features=8, bias=False)
)
)
(final_norm): InklingRMSNorm((8,), eps=1e-06)
)
)
(lm_head): Linear(in_features=8, out_features=201024, bias=False)
)