11 분 소요

0. Introduction

Paper link

Official repository

Official model card

한 줄 요약: Qwen3.8-Next는 GDN과 sparse attention, 넓어진 residual stream, host memory의 n-gram embedding, Muon을 함께 설계하면서, 모델의 효율을 파라미터 수가 아니라 품질, 실행 비용, 학습 안정성의 결합 문제로 다룬다.

Qwen3.8-Next를 새로운 attention 하나의 제안으로 읽으면 중요한 부분을 놓친다. 논문의 제목에 Evaluation, Efficiency, Training Stability가 함께 들어간 이유가 있다. 더 낮은 학습 손실을 만드는 구조가 실제 평가에서도 좋은지, prefill과 decode에서 비용이 어떻게 달라지는지, 기존 learning rate와 batch size를 그대로 사용할 수 있는지를 한꺼번에 묻는다.

이 문제의식은 모델을 직접 학습하거나 serving하는 입장에서 유용하다. 아키텍처를 바꾸고 이전 설정을 그대로 적용하면, 구조의 차이와 최적화 설정의 차이가 실험 결과에 함께 섞인다. 반대로 활성 파라미터만 보고 효율을 판단하면, lookup table과 KV cache, host-device 전송처럼 실제 시스템에 남는 비용을 놓칠 수 있다.

자료 범위를 먼저 명시한다. 이 초안은 arXiv에 색인된 저자 초록, 공식 저장소 설명, 공식 모델 카드의 공개 사양을 기반으로 작성했다. 논문 PDF 전문과 개별 ablation 표를 직접 확보하지 못했으므로, 공개 자료에서 확인되지 않은 세부 수식과 학습 수치는 재구성하지 않았다. 아래에서 제시하는 비용 분해와 실무 해석은 논문의 공식 측정식과 구분한다.

1. Problem Setting

1-1. 효율의 기준을 하나로 정할 수 없는 이유

공개 설명에 따르면 Qwen3.8-Flash-Next는 본체 125B, 토큰당 활성 파라미터 6B인 MoE 모델이며, 별도로 51B 규모의 n-gram embedding table을 사용한다. 이 table은 가속기 밖의 메모리에 두고 필요한 부분을 가져오는 구조다. 따라서 “6B만 활성화된다”와 “6B 모델만큼의 저장 공간이 필요하다”는 전혀 다른 문장이다. S1, S2

효율을 살피려면 적어도 세 종류의 비용을 분리해야 한다. 학습에서는 forward와 backward뿐 아니라 optimizer state와 통신이 중요하다. Prefill에서는 긴 입력을 한꺼번에 처리하는 attention 연산이 중요하다. Decode에서는 이전 상태와 KV를 읽고, 새 토큰을 생성하기 위한 연산과 데이터 이동이 중요하다.

이 구분은 특정 모델에서 무엇이 반드시 병목이라는 단정이 아니다. 동일한 아키텍처도 context length, batch size, 하드웨어, 병렬화 전략에 따라 병목이 달라지므로, 세 구간의 측정을 서로 대신할 수 없다는 뜻이다.

1-2. 손실이 낮아져도 downstream 성능이 비례하지 않는다

저자 초록에서 특히 중요한 관찰은 n-gram vocabulary를 키우면 loss는 계속 낮아지지만 downstream accuracy는 포화될 수 있다는 점이다. 이 결과는 “추가 용량이 효과가 없다”는 의미가 아니다. 추가 용량이 최적화하는 신호와 최종 평가가 요구하는 능력이 완전히 일치하지 않는다는 뜻이다. S1

따라서 후보 구조를 비교할 때 loss만으로 순위를 정하면 충분하지 않다. 좋은 구조는 같은 비용에서 더 낮은 loss를 만드는 데 그치지 않고, 실제로 필요한 평가에서 개선을 유지해야 한다. 그렇지 않으면 사전학습 지표의 개선을 얻기 위해 더 큰 메모리 체계만 떠안는 선택이 될 수 있다.

1-3. 구조를 바꾸면 최적의 학습 설정도 바뀐다

이 논문은 아키텍처와 Muon의 조합이 최적 learning rate와 batch size를 더 큰 쪽으로 이동시키며, 해당 실험에서는 batch-size warmup의 필요성도 줄인다고 보고한다. 여기서 말하는 것은 batch size를 점진적으로 키우는 절차다. 이를 learning-rate warmup이 항상 불필요하다는 주장으로 바꾸면 안 된다. S1

핵심은 새로운 구조에 기존 hyperparameter를 그대로 적용한 결과만으로 우열을 판단하지 말자는 것이다. 구조가 안정적으로 허용하는 학습 영역 자체가 달라질 수 있기 때문이다.

2. Core Idea

2-1. 네 구성 요소의 역할 분담

공식 저장소는 변경점을 attention, residual, embedding, optimization의 네 축으로 정리한다. 이를 기능의 관점에서 다시 읽으면 다음과 같다. S2

구성 요소 직접 바꾸는 부분 설계 의도
GDN + QSA 과거 문맥을 처리하고 조회하는 방식 압축된 상태 갱신과 선택적 문맥 조회를 함께 사용한다.
Gated Residual 층 사이에서 정보를 읽고 쓰는 경로 넓어진 residual stream의 활용을 gate로 제어한다.
N-gram embedding 국소 문맥에 대응하는 추가 용량 큰 backbone 연산을 늘리는 것과 다른 방식으로 용량을 제공한다.
Muon 기반 최적화 행렬 파라미터의 갱신과 설정 선택 구조 변경이 허용하는 학습 효율과 안정성을 함께 탐색한다.

이 네 가지를 각각 독립적인 성능 향상 기법으로 더하기만 하면 논문의 의도가 약해진다. GDN으로 줄어든 전역 attention의 빈도, QSA가 선택하는 문맥의 범위, residual stream의 정보 흐름, 외부 table의 접근 비용은 하나의 학습 및 실행 경로 안에서 만난다.

2-2. 저장 용량, 활성 연산, 정보 접근을 분리한다

이 구조에서 흥미로운 점은 용량을 늘리는 방식과 토큰마다 수행하는 연산을 분리한다는 것이다. MoE는 일부 expert만 사용한다. N-gram embedding은 국소 문맥에 해당하는 table 항목을 조회한다. QSA는 긴 문맥의 모든 항목을 동일한 비용으로 정밀하게 계산하는 대신, indexer가 고른 micro-block을 사용한다. S2

다만 세 종류의 희소성을 같은 것으로 보면 안 된다. Expert sparsity는 어떤 파라미터를 계산에 사용할지의 문제다. Attention sparsity는 어떤 문맥에 접근할지의 문제다. Lookup 기반 용량은 정보를 어떤 저장 구조에서 가져올지의 문제다. 각각 줄이는 비용과 남기는 비용이 다르다.

3. Architecture / Method

3-1. GDN과 전역 attention의 계층별 혼합

저자 설명에서 기본 token mixer는 GDN 세 층과 전역 attention 한 층을 반복하는 구조다. 이후 continued pretraining에서 전역 full-attention 층을 QSA로 교체한다. 즉 처음부터 모든 층을 동일한 sparse attention으로 학습한 모델이라는 설명과는 구분해야 한다. S1

공식 모델 카드의 공개 설정은 전체 48개 층이며, 이 비율을 유지한다. GDN은 문맥을 상태로 압축해 처리하는 경로를 제공하고, attention 계열 층은 선택한 문맥을 조회하는 경로를 제공한다. 두 경로를 함께 사용한다는 점이 중요하다. S3

여기서 GDN의 정확한 update equation, gate parameterization, normalization 순서는 공개 초록만으로 결정할 수 없다. 일반적인 Gated DeltaNet 수식을 가져와 이 모델의 구현식이라고 적는 대신, 이 리뷰에서는 확인 가능한 역할 분담에 초점을 맞춘다.

3-2. QSA: 토큰 하나가 아니라 micro-block을 선택한다

QSA는 가벼운 indexer로 문맥을 평가하고, 작은 block 단위로 정밀 attention의 대상을 고른다. 공식 모델 카드에서는 선택 budget을 512 blocks 또는 2,048 tokens로 설명한다. 이 사양은 block 선택의 단위와 attention budget을 구분해 읽는 데 도움이 된다. S2, S3

선택적 조회를 설명하기 위한 개념식은 다음처럼 쓸 수 있다. 이 식은 논문의 정확한 indexer scoring equation이 아니라, 선택 단계와 attention 단계를 구분하기 위한 표기다.

$$ \mathcal{B}_t = \operatorname{TopK}(s_t, K_B) $$
$$ z_t = \operatorname{Attention}(q_t, K_{\mathcal{B}_t}, V_{\mathcal{B}_t}) $$

여기서 $s_t$는 시점 $t$에서의 block별 점수, $K_B$는 선택할 block 수, $\mathcal{B}_t$는 선택된 block 집합이다. 핵심은 비싼 attention 전에 더 저렴한 선택 과정을 둔다는 것이다.

중요한 주의점도 있다. 선택된 토큰 수가 제한된다는 사실만으로 전체 비용이 context length와 무관하다고 결론 내릴 수는 없다. Indexer가 유지하는 정보, block 구성, KV의 보관 및 접근 비용을 함께 봐야 한다. Sparse attention을 사용한다는 이유만으로 “필요 없는 KV를 모두 폐기한다”고 해석하는 것도 잘못이다.

3-3. Gated Residual: 더 넓은 정보 경로를 제어한다

Gated Residual은 residual stream을 네 branch로 넓히고 gate를 통해 정보를 읽고 쓰게 한다. 공식 모델 카드에서는 data-dependent elementwise read gate와 branch별 scalar write gate를 설명한다. S2, S3

이 설계의 직관은 층 사이에 전달되는 정보를 단일 벡터의 반복적인 덧셈으로만 제한하지 않는 것이다. 여러 경로에 정보를 남기고, 현재 계산이 필요로 하는 부분을 선택적으로 읽을 수 있다.

그러나 “branch가 네 개이므로 Transformer block도 네 배 계산한다”는 설명은 맞지 않는다. 넓어진 residual state와 실제로 수행하는 모듈 연산은 서로 다른 대상이다. 반대로 넓어진 상태를 관리하는 비용이 없다고 말할 수도 없다. 논문이 강조하는 효율 평가는 바로 이런 추가 비용이 실제로 어느 정도인지 확인하는 절차다.

이 리뷰에서는 정확한 gate 초기화, branch mixing 및 normalization 식을 임의로 복원하지 않는다. 해당 내용은 원문 architecture 절과 구현을 추가 대조해야 한다.

3-4. N-gram embedding: 국소 문맥을 별도 용량으로 처리한다

N-gram embedding은 현재 토큰 하나만이 아니라 국소 토큰 조합을 이용해 table을 조회한다. 공식 공개 사양은 bigram과 trigram을 사용하고, 해당 embedding을 한 층에서 주입하는 구조를 설명한다. S3

Host memory에 있는 table을 사용한다는 것은 가속기의 연산 중심 파라미터와 별도로 용량을 확보하려는 선택이다. 필요한 항목을 미리 가져오는 asynchronous prefetch를 모델 계산과 겹쳐 실행하는 것이 공식 설명의 핵심이다. S2

실무적으로는 세 질문이 생긴다. 조회할 항목을 얼마나 일찍 알 수 있는가, 가져오는 동안 다른 연산을 충분히 수행할 수 있는가, cache miss가 생겼을 때 지연이 얼마나 커지는가다. 이는 저자가 공개 초록에서 수치로 답한 결과가 아니라, 구조를 실제 시스템으로 옮길 때 추가로 측정할 항목이다.

큰 table을 CPU 쪽으로 옮겼다고 해서 메모리 요구량이 사라지는 것은 아니다. 위치가 바뀌었고, 접근 방식이 달라졌을 뿐이다. 배포에서는 GPU 메모리만이 아니라 host RAM과 전송 경로를 함께 계획해야 한다.

3-5. Muon: optimizer 이름보다 파라미터 취급 방식이 중요하다

공식 저장소는 Muon을 사용하되 orthogonalization의 정확도, Muon과 AdamW의 역할 분담, fused parameter의 분할을 함께 검토했다고 설명한다. 새 구조에 맞춰 scaling law도 다시 적합한다. S2

이 지점은 “AdamW 대신 Muon을 선택했다”보다 구체적이다. 구현에서 함께 저장된 행렬이 최적화 관점에서도 하나의 단위여야 하는지는 별도 문제다. Fused parameter를 어떤 단위로 취급하는지에 따라 구조의 의미와 optimizer가 처리하는 행렬의 의미가 달라질 수 있다.

정확히 어떤 tensor를 어떤 optimizer에 배정했는지, orthogonalization 반복 수가 얼마인지는 이번에 확보한 자료만으로 전부 확인되지 않았다. 따라서 바로 실행할 수 있는 학습 설정처럼 값을 채워 넣지는 않는다.

4. Training / Data / Recipe

4-1. 확인 가능한 학습 흐름

공개 자료에서 확인되는 큰 흐름은 hybrid backbone 학습, continued pretraining에서의 QSA 도입, 새 아키텍처와 optimizer에 대한 설정 재탐색이다. 공식 모델 카드는 공개 checkpoint에 pretraining과 post-training이 적용되었다고 명시한다. S1, S3

여기서 논문의 pretraining 비교와 배포된 post-trained 모델의 평가를 분리해야 한다. 두 결과는 서로 다른 질문에 답한다. 전자는 설계와 학습 효율을 살피는 근거이고, 후자는 이후 학습을 거친 실제 모델의 사용 능력을 살피는 근거다.

데이터의 전체 token 수, 언어별 비율, 정제 및 중복 제거 조건, 각 단계의 학습 길이는 원문에서 추가 확인이 필요하다. “이전 모델의 1/3 tokens”라는 상대량만으로 절대 데이터 규모를 역산하지 않는다.

4-2. 공정한 구조 비교를 위한 실험 설계

다음은 저자의 공개 결과를 바탕으로 한 재현 실험 제안이다. 논문에서 수행한 모든 ablation을 그대로 옮긴 목록은 아니다.

먼저 동일한 hyperparameter에서 비교한 결과와 각 구조별로 설정을 조정한 결과를 나눠 기록해야 한다. 전자는 교체 직후의 효과를, 후자는 구조가 허용하는 최적 성능을 보여준다. 둘 중 하나만으로 다른 하나를 대신할 수 없다.

그다음 학습 예산을 token 수와 FLOPs 양쪽에서 기록해야 한다. 같은 token을 처리해도 구조에 따라 연산량이 다르며, 같은 FLOPs를 사용해도 필요한 wall-clock이 같지는 않다. 마지막으로 loss, downstream 성능, 불안정한 run의 비율을 함께 남겨야 한다.

4-3. 배포 비용을 분해해서 읽기

구현 비용을 생각하기 위한 분석 틀은 다음과 같다. 아래 식은 저자의 측정 결과나 정확한 runtime 식이 아니다.

$$ \begin{aligned} C_{\mathrm{step}} &\approx C_{\mathrm{mixer}} + C_{\mathrm{experts}} \\ &\quad + C_{\mathrm{indexer}} + C_{\mathrm{lookup}} \\ &\quad + C_{\mathrm{communication}} \end{aligned} $$

연산을 겹쳐 실행하면 실제 지연은 각 항의 단순 합과 달라질 수 있다. 그럼에도 이 분해는 무엇을 측정해야 하는지 빠뜨리지 않게 한다. GDN과 QSA로 mixer 비용을 줄였더라도, host lookup이나 통신이 새 병목이 되면 end-to-end 이득은 작아질 수 있다.

실제 재사용에서는 먼저 짧은 입력과 긴 입력을 나누고, prefill과 decode를 분리한 다음, batch size를 바꾸면서 측정하는 편이 좋다. 단일 context length에서 얻은 속도 배수 하나로 전체 workload를 설명하지 않는 것이 중요하다.

5. Evaluation

5-1. 공개 초록에서 확인되는 비교 결과

저자 초록의 비교는 397B-A17B 이전 모델을 기준으로 한다. 14개 pretraining benchmark 중 8개에서 앞서며, 나머지에서는 최대 2.6점 이내의 차이를 보고한다. 활성 파라미터와 학습 token은 각각 약 1/3, 학습 FLOPs는 약 1/9 수준이라는 상대 비교다. S1

비교 축 공개된 결과 해석 시 주의점
Pretraining 평가 14개 중 8개에서 이전 모델보다 높음 모든 benchmark에서 우수하다는 의미가 아니다.
나머지 평가 차이가 최대 2.6점 이내 개별 task의 정의와 점수 척도는 원문 표를 확인해야 한다.
활성 파라미터 6B 대 17B 추가 embedding table의 저장 비용과는 별개다.
학습 token 이전 모델 대비 약 1/3 데이터 품질과 구성의 동일성을 뜻하지 않는다.
학습 FLOPs 이전 모델 대비 약 1/9 시간, 비용, 에너지의 동일한 배율을 보장하지 않는다.

이 비교는 효율과 성능의 결합 결과로 의미가 있다. 다만 개별 구성 요소가 각각 어느 정도 기여했는지는 최종 모델 비교만으로 분해할 수 없다. 그 판단에는 본문 ablation의 통제 조건이 필요하다.

5-2. 더 중요한 결과는 평가 축 사이의 불일치다

N-gram table 확대에 따른 loss 개선과 downstream 포화는 좋은 예다. 이 결과는 최적의 모델 크기를 결정할 때 단일 scaling curve만 보는 것이 위험할 수 있음을 보여준다. 같은 추가 용량이 모든 종류의 능력으로 전환되는 것은 아니기 때문이다.

학습 안정성도 비슷하다. 큰 learning rate와 batch size를 사용할 수 있다는 사실은 잠재적인 처리 효율의 개선으로 연결될 수 있지만, 그 효과를 실제 throughput 및 수렴 시간으로 확인해야 한다. 안정적인 설정 범위가 넓어지는 것과 특정 하드웨어에서 더 빨라지는 것은 구분해야 한다.

5-3. 숫자를 읽을 때 남겨야 할 질문

후속 검토에서는 같은 데이터와 token 예산에서의 비교인지, 같은 연산 예산에서의 비교인지부터 확인해야 한다. QSA의 효과는 선택 budget과 context length에 따라 달라질 수 있으므로 짧은 문맥과 긴 문맥을 나눠 보아야 한다. GR의 효과도 최종 점수뿐 아니라 loss spike와 실패한 run을 함께 보아야 한다.

개별 benchmark 점수, prefill 및 decode 가속 배수, stress-test 설정은 이번 자료 범위에서 원문 대조를 완료하지 못했다. 따라서 이 글에서는 확인되지 않은 정밀 수치를 성능 표에 추가하지 않았다.

6. Limitations

첫째, 공개 자료로 확인되는 것은 유력한 설계 조합의 결과이지, 각 모듈이 모든 모델과 예산에서 독립적으로 같은 이득을 낸다는 보장은 아니다. GDN, QSA, GR, n-gram embedding, optimizer가 함께 변경되므로 개별 기여는 통제된 ablation으로 읽어야 한다.

둘째, 가속기 밖의 용량은 공짜 용량이 아니다. Host RAM, prefetch, 전송 및 cache 동작을 포함한 시스템 제약이 남는다. 이 부분은 구조적 특성에서 도출되는 실무 주의점이며, 여기서 특정 하드웨어의 병목이 확인되었다고 주장하는 것은 아니다.

셋째, pretraining benchmark에서의 근접한 성능을 모든 agentic workload의 동등성으로 확대할 수 없다. Post-training 데이터, harness, 도구 환경과 추론 예산은 별도 변수다.

넷째, 이번 리뷰는 PDF 전문을 직접 검토하지 못했다. 따라서 저자가 본문에서 열거한 한계, ablation의 세부 조건, 데이터 및 하드웨어 명세를 모두 정리한 최종 리뷰는 아니다. 특히 정확한 구현 수식과 재현 hyperparameter는 추가 확인 대상으로 남긴다.

7. My Take

7-1. 아키텍처의 단위는 모듈보다 학습 가능한 시스템이다

이 작업의 가장 재사용 가치가 큰 부분은 특정 모듈 하나보다 평가 방식이다. 구조 변경을 loss 개선으로만 승인하지 않고, downstream 전이와 실행 구간별 비용, 최적 설정의 이동까지 함께 확인하는 방식이다.

아키텍처 탐색에서는 성능이 낮은 후보를 너무 빨리 버리기도 하고, 손실이 좋은 후보를 너무 오래 유지하기도 한다. 이 논문이 제시하는 관점은 두 실수를 모두 줄이는 데 도움이 된다. 구조와 optimizer를 분리하지 않되, 최종 조합의 성과를 개별 모듈의 성과로 과도하게 분배하지 않는 것이다.

7-2. 실험 규모가 작을 때도 가져올 수 있는 것

전체 모델을 재현하지 못하더라도 평가 축은 가져올 수 있다. 예를 들어 attention 변경을 시험할 때는 loss와 정답률뿐 아니라 선택 budget별 곡선과 prefill/decode 지연을 함께 기록할 수 있다. Lookup 용량을 늘릴 때는 손실 개선과 downstream 포화가 시작되는 지점을 따로 찾을 수 있다.

Residual 구조나 optimizer를 바꿀 때는 고정 learning rate 한 점 대신 작은 범위라도 sweep을 수행하는 편이 낫다. 좋은 설계가 특정 설정에서만 유효한지, 넓은 영역에서 안정적인지를 확인하는 것이 실제 학습 비용을 줄이는 데 더 중요할 수 있다.

7-3. 후속으로 연결할 자료

이 글 다음에는 공식 모델 카드를 통해 실제 checkpoint의 구조와 serving 제약을 대조하고, 공식 저장소의 기술 보고서에서 모듈별 ablation을 확인하는 순서가 적절하다. 전자는 공개 artifact를, 후자는 설계의 근거를 확인하는 자료다. 두 종류의 근거를 합쳐야 “무엇이 구현되었는가”와 “왜 선택했는가”를 구분할 수 있다.

8. Summary

  • Qwen3.8-Next는 token mixer, residual, lookup 용량, optimizer를 함께 설계한다.
  • GDN과 QSA는 압축된 상태 처리와 선택적 문맥 조회를 나누어 담당한다.
  • GR과 n-gram embedding은 정보 흐름과 용량 배치를 바꾸지만 추가 비용도 남긴다.
  • 활성 파라미터, 학습 FLOPs, 저장 공간, 실제 지연은 서로 다른 효율 지표다.
  • 가장 중요한 관점은 loss, downstream 성능, 실행 비용, 학습 안정성을 함께 판단하는 것이다.

댓글남기기