어제 Qwen이 Qwen3.8-27B를 공개했다. 인터넷 커뮤니티는 여느 때와 다름없이 벤치마크 표를 공유하며 SWE-bench Pro의 61.7점이 Claude Opus를 이겼는지 아닌지를 두고 논쟁을 벌이고 있다. 하지만 이 모델에서 정작 흥미로운 부분은 단순한 점수 놀음이 아니다. 바로 모델 내부의 아키텍처 설계다.

DeltaNet 하이브리드 아키텍처

아키텍처 세부 명세를 자세히 들여다보자. 대부분 무심코 지나치겠지만, 절대 그냥 넘겨선 안 되는 지점이다.

은닉층 레이아웃은 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) 형태로 구성되어 있다. 즉, 매 4개의 서브 레이어 중 3개는 선형 어텐션(Linear Attention)인 DeltaNet을 사용하고, 단 1개 레이어만 기존의 소프트맥스(Softmax) 어텐션을 사용한다. 이는 표준적인 트랜스포머 구조와는 완전히 다르다.

DeltaNet은 시퀀스 길이에 따라 $O(n^2)$이 아닌 $O(n)$의 선형 복잡도를 갖는 선형 어텐션 메커니즘이다. 모든 토큰 간의 풀 어텐션을 계산하는 대신, 고정된 크기의 상태(state)를 유지하며 시퀀스를 처리한다. ‘Gated’ 변형은 학습 가능한 게이트를 추가하여 해당 상태에 어떤 정보를 기록하고 읽어올지를 제어한다.

이것이 실무에서 갖는 의미는 명확하다: 모델 연산의 대부분이 시퀀스 길이에 비례해 이차식이 아니라 선형적으로 증가한다는 점이다. 소프트맥스 어텐션 레이어(24개의 Query 헤드, 4개의 Key-Value 헤드로 구성된 공격적인 GQA 비율)는 긴밀한 장기 의존성이나 정밀한 검색이 반드시 필요한 상황만을 전담한다. 그리고 전체 레이어의 75%는 이 무거운 비용을 치르지 않는다.

Qwen이 추론 처리량을 완전히 희생시키지 않으면서도 기본 262K, YaRN 스케일링 적용 시 1M(100만) 토큰에 달하는 컨텍스트를 지원할 수 있다고 주장하는 배경이 바로 여기에 있다. 27B 파라미터 규모에서 262K 컨텍스트를 순수 소프트맥스 트랜스포머로 서빙하는 것은 상상만 해도 끔찍한 일이다. 하지만 75%가 선형 어텐션으로 채워진 모델이라면 이야기가 완전히 달라진다.

벤치마크 수치와 그 맥락

벤치마크 수치를 객관적으로 짚어보자.

Qwen3.8-27B는 SWE-bench Pro에서 61.7점을 기록했다. Claude Opus 4.6 Max의 점수는 53.4점이다. 얼핏 대단해 보이지만, 각주를 보면 Qwen은 “온도 1.0, top_p=0.95, 256K 컨텍스트 윈도우 환경에서 Claude Code 하네스”를 사용해 평가되었다고 적혀 있다. Claude를 이기기 위해 Claude의 공식 하네스를 쓴 것이다. 넘치는 자신감인지 벤치마크용 노림수인지 모르겠으나, 아마 둘 다일 것이다.

더 눈여겨볼 부분은 Qwen 자체 라인업 내에서의 발전이다. 동일한 하네스로 측정한 Qwen3.6-27B는 53.5점, Qwen3.7-Plus는 57.6점이었다. 3.6에서 3.8로 넘어가며 8.2점이 올랐다. 이는 자체 혈통 내에서 실질적인 개선이 이루어졌음을 보여주며, SWE-bench Pro, Terminal Bench, CoWorkBench 등 전반적인 벤치마크에서 3.6 대비 일관되게 8~12점의 상승폭을 보이고 있다.

진짜 놀라운 수치는 비전-언어(Vision-Language) 영역에서 나온다:

  • OSWorld-Verified: 84.3 (Opus 4.6의 72.7 대비 대폭 상승) — 컴퓨터 사용(Computer Use) 능력
  • WebArena-Verified: 64.8 (경쟁 모델들의 기록 미비) — 브라우저 제어 능력
  • AndroidWorld: 81.9 — 모바일 인터페이스 제어
  • Vision2Web: 62.9 — 시각적 웹 개발 역량

단순히 소수점 몇 점 앞선 수준이 아니다. OSWorld에서 11.6점 차이는 엄청난 격차다. 27B 오픈 모델이 컴퓨터 제어 평가에서 거대 상용 모델인 Opus를 두 자릿수 격차로 따돌렸다는 점이야말로 SWE-bench보다 훨씬 더 주목해야 할 헤드라인이다.

생각(Thinking) 제어 기능의 성숙도

Qwen3.8은 생각(추론) 모드가 기본으로 켜져 있다. Qwen3.5에서도 그랬으니 새로울 것은 없다. 하지만 이를 제어하는 인터페이스가 한층 성숙해졌다:

  • reasoning_effort: xhigh(기본값), medium, low의 3단계 설정 지원
  • preserve_thinking: 기본 활성화되어 이전 턴들의 추론 궤적을 다음 메시지에서도 유지
  • enable_thinking: 요청 단위로 생각 모드 온/오프 가능

특히 preserve_thinking 기능은 에이전트 워크플로우에서 결정적인 가치를 갖는다. 여러 턴이 오가는 작업에서 모델이 매 턴마다 기초적인 논리를 바닥부터 다시 전개하도록 만드는 것은 엄청난 낭비다. 추론 기록이 유지되면 모델은 “3턴 전에 이미 이 문제를 고민해 결론을 내렸으니, 그 위에 다음 논리를 쌓자”라고 판단할 수 있다. 에이전트 루프의 실질적인 효율을 크게 높여주는 기능이다.

공식 문서에는 정직한 경고도 포함되어 있다: “추론 강도(reasoning effort)를 낮춘다고 해서 작업의 전체 완료 시간이 항상 단축되는 것은 아니다.” 턴당 응답은 빨라질지 몰라도 실패와 재시도가 늘어나기 때문이다. 다른 추론형 모델들에서도 흔히 관찰되는 현상이며 매우 현실적인 지적이다. 복잡한 작업에서 추론 예산을 섣불리 깎는 것은 소탐대실이 되기 쉽다.

진정한 혁신과 점진적 개선

진짜 새로운 점:

  • DeltaNet 하이브리드 아키텍처: 선형 어텐션을 과반 이상의 주력(75%)으로 채택한 최초의 양산형 오픈 모델이다. 벤치마크만큼의 실효성이 입증된다면 다른 AI 연구소들도 유사한 비율을 시도할 것이다.
  • 네이티브 비전-언어 스택: 껍데기만 씌운 것이 아니라 모델 본체에 내장되어 있다. 단일 모델 안에서 이미지와 비디오 이해를 모두 지원하며, 프레임 샘플링 조절을 통해 수 시간 분량의 비디오 분석도 처리한다.
  • MTP(Multi-Token Prediction) 학습: 명세서에는 여러 단계로 학습되었다고 언급되어 있다. 주로 메타(Meta)의 연구 등에서 탐색되던 MTP가 실제 오픈 프로덕션 모델에 적용된 것은 드문 사례다.

점진적 개선에 머문 점:

  • 강도 조절이 가능한 생각 모드: Claude나 Gemini도 이미 제공하고 있는 기본 기능이다.
  • 262K 기본 컨텍스트 및 YaRN 기반 1M 확장: 표준적인 RoPE 스케일링 방식이다. 안정적이지만 특별히 새로운 기법은 아니다.
  • 벤치마크 점수 향상: 동일한 구조를 더 정제된 데이터와 강화된 학습으로 밀어붙인 결과로, 예상 가능한 우상향 곡선이다.

아키텍처가 시사하는 바

DeltaNet 하이브리드가 벤치마크 수치 이상으로 중요한 이유는 서빙(serving) 경제성을 근본적으로 바꾸기 때문이다.

75%가 선형 어텐션으로 구성된 27B 모델은 순수 트랜스포머 27B 모델과 완전히 다른 메모리 및 연산 특성을 갖는다. 선형 어텐션 레이어의 KV 캐시 크기는 고정되어 있어 시퀀스 길이가 늘어나도 커지지 않는다. 오직 25%의 소프트맥스 어텐션 레이어만이 전통적인 KV 캐시를 소모할 뿐이다.

262K에서 1M에 이르는 롱 컨텍스트 워크로드에서 이는 다음과 같은 이점을 가져온다:

  • 긴 시퀀스에서도 현저히 낮은 메모리 압박
  • 시퀀스 길이에 따른 예측 가능한 지연 시간(latency) 증가폭
  • 긴 입력값 처리에 대한 월등한 처리량(throughput)

여기에 소프트맥스 레이어에 적용된 6:1의 공격적인 GQA(Query 24개, KV 4개) 설계까지 더해져 KV 캐시의 메모리 점유율을 극한으로 낮췄다. 이 모델이 단순한 벤치마크용 쇼케이스가 아니라, 실무에서의 대규모 서빙을 깊이 염두에 두고 설계되었음을 알 수 있다.

앞으로 지켜보아야 할 점

세 가지를 눈여겨보아야 한다:

1. 서빙 프레임워크 최적화: 표준 트랜스포머가 아니기 때문에 DeltaNet 레이어에 대한 최적화가 필수적이다. vLLM, SGLang 등이 지원을 표방하고 있으나, 단순 ’작동’과 하드웨어 레벨의 ’최적화된 지원’은 전혀 다른 문제다. 이 구조에서 실제로 나오는 추론 처리량 벤치마크를 확인할 필요가 있다.

2. 파인튜닝 생태계: DeltaNet 레이어는 일반 어텐션 레이어와 그래디언트 전파 특성이 다르다. Llama 스타일에 최적화된 기존 파인튜닝 레시피가 그대로 들어맞지 않을 수 있다. Qwen 팀의 공식 파인튜닝 가이드라인을 기다려봐야 한다.

3. 27B 파라미터의 절묘한 위치: 27B는 매우 매력적인 체급이다. 충분히 똑똑하면서도 고사양 단일 GPU에 얹어 구동할 수 있는 크기다. 선형 어텐션의 효율성 덕분에, 롱 컨텍스트 작업을 로컬 프로덕션 환경에서 쾌적하게 돌릴 수 있는 최초의 27B 모델이 될 가능성이 있다.

맺으며

Qwen3.8-27B는 흔한 벤치마크 갱신용 모델이 아니다. DeltaNet 하이브리드 아키텍처는 표준 트랜스포머의 구조적 한계를 넘어서려는 진지한 시도이며, 이 체급의 오픈 모델에서 보여주는 비전-언어 제어 능력은 독보적이다. 평가 하네스나 프롬프트 기법에 따른 벤치마크의 과장은 걸러 듣더라도, 3.6에서 3.8로 이어지는 모델의 내부 진화 곡선은 매우 강력하고 일관적이다.

에이전트 워크로드를 위해 오픈소스 모델을 검토하고 있다면, Qwen3.8-27B는 반드시 테스트해 볼 가치가 있다. SWE-bench 점수 때문이 아니라, 실무 환경에서 진짜 중요한 긴 컨텍스트, 멀티턴 대화, 화면 인식 기반 작업에 최적화된 아키텍처를 품고 있기 때문이다.

27B 크기는 현실적으로 직접 띄울 수 있는 규모다. 그리고 DeltaNet 아키텍처는 그 모델이 실제로 가볍고 빠르게 돌 수 있는 근거를 제공한다.


참고자료: Qwen3.8-27B Model Card