오늘날 우리가 상호작용하는 모든 프론티어 LLM—GPT-5, Claude, Gemini, DeepSeek-V3, Llama 4—은 디코더 전용(decoder-only) 트랜스포머다. 이것은 사실이다. 하지만 이를 두고 AI 분야가 “정체되었다”고 말하는 것은 비행기가 여전히 날개에 갇혀 있다고 말하는 것과 같다. 하중을 지탱하는 기본 원리는 유지되고 있지만, 그 주변의 모든 것은 이미 완전히 새로 지어졌다. 어떤 부분은 몇 번이나 허물고 다시 지어졌다.

2026년의 트랜스포머가 내부적으로 실제로 어떤 모습을 하고 있는지, 그리고 어디에서 균열이 시작되고 있는지 살펴보자.

2017년의 트랜스포머는 사실상 죽었다

논문 “Attention Is All You Need”에 등장했던 원래의 아키텍처—사인파 위치 인코딩, 포스트-레이어 정규화(Post-LN), ReLU 활성화 함수, 인코더-디코더 구조, 조밀한(dense) 피드포워드 네트워크—는 완전히 사라졌다. 조금 수정된 것이 아니라, 아예 사라졌다.

그 자리를 대체한 것은 다음과 같다.

  • 디코더 전용(Decoder-only): 언어 모델에서 인코더 부분은 수년 전에 버려졌다.
  • RoPE(Rotary Position Embedding): 주파수 스케일링 기법과 결합하여 컨텍스트 길이를 4K에서 100만(1M)+ 토큰 이상으로 확장했다.
  • Pre-RMSNorm: LayerNorm을 대체하여 100개 이상의 레이어에서도 안정적인 학습을 가능하게 했다.
  • SwiGLU 게이티드 활성화 함수: ReLU/GELU를 밀어냈다.
  • FP8 네이티브 훈련: DeepSeek-V3가 프론티어 스케일에서 이를 선도적으로 증명했다.
  • GQA(Grouped-Query Attention) 또는 MLA(Multi-head Latent Attention): 표준 멀티헤드 어텐션을 대체했다.

어텐션 블록과 피드포워드 블록이 층층이 쌓여 있는 뼈대 자체는 동일하다. 하지만 내부의 모든 장기는 완전히 새로운 것으로 교체되었다.

전문가 혼합(MoE)이 연산의 장벽을 부쉈다

이것은 2024~2026년 사이 일어난 단 하나의 가장 거대한 아키텍처 전환이며, 전적으로 트랜스포머 패밀리 내부에서 일어났다.

모든 토큰을 단 하나의 거대한 피드포워드 네트워크로 처리하는 대신, MoE 모델은 수십 개에서 수백 개의 작은 ‘전문가(expert)’ 네트워크를 갖춘다. 가벼운 라우터가 토큰당 2~3개의 전문가만 선택하고, 나머지 전문가들은 대기 상태로 둔다.

수치가 이를 증명한다.

  • DeepSeek-V3: 전체 매개변수 6,710억 개(671B). 토큰당 활성화되는 매개변수는 370억 개(37B). 활성화율은 고작 5.5%다.
  • Llama 4 Maverick: 전체 ~400B 중 활성화 17B.
  • GLM-5: 전체 744B 중 활성화 ~40B.

조 단위 매개변수 모델의 지식 수용력을 40B 모델 수준의 추론 비용으로 누릴 수 있게 된 것이다. 프론티어 모델들이 경제성을 유지하며 서비스될 수 있는 비결이 바로 여기에 있다. “그냥 모델을 무작정 키우기만 하자”는 전략이 벽에 부딪혔을 때, MoE가 그 문제를 먹어치웠다.

라우팅 기법의 혁신도 중요하다. DeepSeek는 보조 손실(auxiliary loss) 없이 부하를 분산하는 기법을 개척했다. 특정 전문가에게만 몰리는 붕괴 현상을 막기 위해 손실 함수에 패널티를 주는 대신, 전문가별 부하의 지수 이동 평균(EMA)을 추적하여 라우터 점수를 직접 보정하는 방식이다. 이는 현재 프론티어 모델들의 표준 접근법이 되었다.

KV 캐시 전쟁

자기회귀(autoregressive) 추론의 가장 큰 병목은 과거의 모든 토큰에 대한 키(Key)와 값(Value)을 캐싱해야 한다는 점이다. 100만 토큰 단위의 컨텍스트에서는 이 캐시 용량만으로 GPU VRAM을 초과할 수 있다. 업계는 여러 각도에서 이 문제를 공격했다.

GQA(Grouped-Query Attention): 여러 개의 쿼리 헤드가 키-값 헤드를 공유하도록 만든다. Llama와 Mistral의 표준이다. 품질 손실을 최소화하면서 KV 메모리를 4~8배 절약한다.

MLA(Multi-head Latent Attention): DeepSeek가 시도한 훨씬 과감한 혁신이다. 키와 값을 그대로 저장하는 대신, 캐싱하기 전에 저차원의 잠재 벡터(latent vector)로 압축한다. 표현력을 유지하면서 KV 캐시 용량을 80~90%까지 줄여준다. 지난 10년간 가장 영향력 있는 어텐션 재설계라 해도 과언이 아니다.

FlashAttention: 수학적 계산을 바꾸지는 않지만, 메모리 접근 패턴을 근본적으로 바꾼다. 느린 HBM을 오가는 대신 빠른 SRAM 내부에서 어텐션을 계산함으로써 FlashAttention-3는 H100 GPU에서 75% 이상의 연산 활용률을 달성한다. 이 커널이 없었다면 128K~1M 토큰 길이의 컨텍스트 학습은 계산적으로 불가능했을 것이다.

슬라이딩 윈도우 및 희소 어텐션(Sparse Attention): 대부분의 레이어는 가까운 토큰만 바라보게 하고, 소수의 레이어만 전체 글로벌 어텐션을 수행하도록 한다. 나머지는 저렴한 로컬 패턴을 사용한다.

그 결과, 겉으로는 여전히 “트랜스포머”라는 이름을 달고 있지만 2017년 논문이 의도했던 방식과는 완전히 다르게 어텐션을 계산하는 모델들이 탄생했다.

테스트 타임 연산: 아키텍처를 전혀 건드리지 않은 역량의 도약

아키텍처 토론에서 가장 흔히 놓치는 핵심적인 지점이다.

GPT-3 이후 가장 거대한 역량의 도약이었던 추론 모델들—o1/o3, DeepSeek-R1, 클로드(Claude)의 확장 사고(extended thinking)—은 아키텍처 수준의 변화가 전혀 없었다. 이 모델들은 구조적으로 이전 세대 모델들과 완벽히 동일하다.

바뀐 것은 학습 목표(training objective)뿐이다. 검증 가능한 보상(verifiable rewards)을 기반으로 한 대규모 강화학습(RL)을 통해, 모델이 최종 답변을 내놓기 전에 긴 생각의 사슬(Chain of Thought)을 풀고, 되돌아가고, 계획을 세우며, 스스로를 교정하도록 훈련시켰다. 추론 시점에 모델은 쿼리당 밀리초 단위가 아니라 수 분 단위의 컴퓨팅 파워를 사용한다.

수학, 과학, 코딩 작업에서 테스트 타임 연산(Test-time compute)을 사용하는 소형 모델은 단 한 번의 순방향 패스로 탐욕적 디코딩(greedy decoding)을 수행하는 거대 모델을 체계적으로 압도한다. 2025~2026년에 진정으로 중요했던 스케일링 법칙은 트랜스포머의 ’내부’가 아니라 트랜스포머의 ’바깥’에서 일어났다.

진짜 도전자들: 대체재가 아닌 하이브리드

순수한 대안 아키텍처가 프론티어 스케일에서 트랜스포머를 완전히 몰아낸 사례는 아직 없다. 하지만 트랜스포머 어텐션 레이어와 다른 메커니즘을 교차 배치한 하이브리드(Hybrid) 모델들은 이미 프로덕션에서 서비스되며 뛰어난 경제성을 증명하고 있다.

Mamba와 같은 **상태 공간 모델(State Space Models, SSM)**은 토큰 간 쌍별(pairwise) 어텐션을 지속적으로 진화하는 잠재 상태(latent state)로 대체한다. 선형 시간(linear-time) 추론이 가능하고 어텐션 행렬이 없으며 KV 캐시가 극적으로 작아진다. 단점은 순수 SSM이 정확한 회상(exact recall)—어텐션이 아주 쉽게 해내는 ‘건초더미 속 바늘 찾기’—에서 측정 가능할 정도로 취약하다는 점이다.

하이브리드 해법: 대규모 시퀀스 처리는 비용이 저렴한 순환/SSM 레이어에 맡기고, 정밀한 정보 검색이 필요한 곳에만 드물게 풀 어텐션 레이어를 배치하는 방식이다. 이미 배포되고 있는 실제 모델들은 다음과 같다.

  • Nemotron-H (NVIDIA): 어텐션 레이어의 92%를 Mamba-2 블록으로 대체했다. 17개 벤치마크 중 16개에서 Llama-3.1-70B와 동등한 성능을 내면서 처리량은 3배 향상되었다. 47B 모델의 경우 단 한 장의 RTX 5090에서 100만 토큰 추론이 가능하다.
  • Jamba 1.5 (AI21): 어텐션과 Mamba의 비율을 1:7로 두고 MoE를 결합했다. 전체 398B, 활성화 94B, 256K 컨텍스트를 지원한다. 대규모 상용화에 성공한 최초의 하이브리드다.
  • Falcon-H1 (TII): 동일한 레이어 내부에서 어텐션 헤드와 Mamba-2 헤드를 병렬로 배치했다. 긴 컨텍스트에서 순수 트랜스포머 대비 입력 처리량은 최대 4배, 출력은 최대 8배 빠르다.
  • Qwen3-Next (알리바바): 선형 어텐션인 Gated DeltaNet을 주력으로 쓰고 몇 레이어마다 풀 어텐션을 배치했다. 전체 80B, 활성화 3B다.

2025~2026년에 공개된 오픈 웨이트 신규 모델 중 하이브리드 아키텍처의 비중은 약 8%다. 아직 작지만 빠르게 성장하고 있으며, 모든 주요 AI 연구소의 롱 컨텍스트 로드맵에는 하이브리드가 포함되어 있다.

확산 언어 모델(Diffusion LMs): 완전히 다르지만 아직 초기 단계

자기회귀 생성 방식으로부터의 가장 급진적인 이탈이다. 왼쪽에서 오른쪽으로 한 번에 하나의 토큰을 예측하는 대신, 확산(diffusion) 모델은 전체 시퀀스의 노이즈를 병렬로 반복해서 제거해 나간다.

Mercury Coder (Inception Labs): H100에서 초당 1,109토큰을 기록했다. 속도에 최적화된 자기회귀 모델들보다 약 10배 빠르다. 현재 퍼블릭 API를 통해 프로덕션 서비스 중이다. 전체 모델 중 가장 빠른 속도를 자랑하면서 코파일럿 아레나 품질 벤치마크 2위에 올랐다.

LLaDA (8B, 오픈 웨이트): 밑바닥부터 학습된 확산 모델이 인-컨텍스트 러닝과 지시 따르기에서 LLaMA3 8B와 맞먹을 수 있음을 증명했다. 후속인 iLLaDA는 12조 토큰의 사전 학습, GQA, 가변 길이 생성을 적용해 성능을 한 단계 더 끌어올렸다.

하지만 여기서 아무도 주목하지 않는 반전이 있다. Mercury의 노이즈 제거기(denoiser) 백본은 여전히 트랜스포머다. 확산은 생성 알고리즘을 바꾼 것이지, 기본 뼈대를 바꾼 것이 아니다. 혁명가들조차 어텐션을 완전히 벗어나지 못하고 있는 것이다.

왜 완전한 대체가 일어나지 않는가

트랜스포머를 왕좌에 묶어두고 있는 세 가지 해자(moat)가 있다.

하드웨어와의 공동 진화: 지난 9년간 구축된 GPU 커널 최적화, FlashAttention, TensorRT-LLM, vLLM, 양자화 도구들은 모두 어텐션과 행렬 곱셈 연산에 맞춰 조율되어 왔다. 기술적으로 더 우월한 아키텍처라 할지라도, 현존하는 실리콘 위에서 3배 느리게 돈다면 경쟁에서 패배한다.

예측 가능한 스케일링: 연구소들은 트랜스포머에 대해 5년간 축적된 스케일링 법칙 데이터를 가지고 있다. 5억 달러짜리 학습 연산을 투입했을 때 어떤 결과물이 나올지 예측할 수 있다. 1조 개 매개변수에서의 거동이 검증되지 않은 새로운 아키텍처에 수천억 원의 베팅을 걸 사람은 아무도 없다.

정확한 회상(Exact Recall): 하버드와 CMU의 연구에 따르면, 트랜스포머는 지수적인 길이의 문자열을 완벽하게 복사할 수 있는 반면, SSM은 고정된 크기의 잠재 상태 때문에 근본적인 한계를 가진다. 그리고 정밀한 정보 검색이야말로 에이전트, 코딩, RAG가 가장 절실히 필요로 하는 핵심 기능이다.

아무도 말하지 않는 숨은 격차: 데이터

LLM 아키텍처 분석은 늘 모델에만 초점을 맞춘다. 하지만 2024~2026년에 이루어진 역량 향상의 상당 부분이 아키텍처가 아니라 데이터 파이프라인에서 비롯되었다는 사실을 이야기하는 사람은 거의 없다. 합성 데이터 생성, 추론 경로 증류, 정밀하게 큐레이션된 학습 데이터셋이 그것이다. Llama 3.1 405B의 출력이 더 작은 형제 모델들의 성능을 끌어올리는 데 쓰였고, Phi 모델들은 교과서 스타일의 합성 데이터로 학습되었다. DeepSeek의 데이터 파이프라인 혁신은 그들의 아키텍처만큼이나 파격적이었다.

헤드라인을 장식하는 것은 아키텍처지만, 정작 일을 해내는 것은 데이터 파이프라인이다.

애플리케이션 개발자에게 주는 의미

대부분의 엔지니어링 팀에게 모델 아키텍처는 직접 제어할 수 없는 구현 세부 사항일 뿐이다. 상용 API 제공업체는 자체 평가에서 가장 높은 점수를 받은 모델을 서빙할 뿐이며, 당신은 MoE냐 Dense냐를 고르는 것이 아니라 GPT-5냐 Claude냐를 고르게 된다.

하지만 온프레미스에서 모델을 직접 호스팅하거나 로컬 추론 스택을 구축하고 있다면 이야기가 달라진다.

  • 256K 이상의 긴 컨텍스트가 필요하다면, 순수 트랜스포머와 함께 Jamba나 Nemotron-H를 진지하게 검토하라. KV 캐시 절감 효과는 매우 실질적이다.
  • 지연 시간에 극도로 민감한 코드 생성 작업이라면 Mercury 같은 확산 모델을 테스트해 볼 가치가 있다.
  • 엣지 디바이스나 CPU 환경에서는 RWKV-7이나 소형 하이브리드 모델이 순수 트랜스포머보다 처리량 면에서 우수하다.
  • 32K 컨텍스트 이하의 일반적인 챗봇이나 에이전트 워크로드라면 아키텍처 선택은 크게 중요하지 않다. 당신의 평가셋에서 점수가 가장 잘 나오는 모델을 고르면 된다.

그리고 만약 모델 자체를 언제든 갈아 끼울 수 있도록 메모리, 도구, 거버넌스, 평가 레이어를 백본 모델과 독립적으로 설계하고 있다면, 당신은 다음에 어떤 혁신이 오더라도 이미 완벽히 준비되어 있는 셈이다. 트랜스포머가 인류의 최종 아키텍처가 될지 아닐지는 알 수 없다. 하지만 모델을 감싸고 있는 시스템 아키텍처가 모델 내부의 아키텍처보다 훨씬 더 중요하다.

결론

트랜스포머는 우리를 가두는 감옥이 아니다. AI 기술을 지탱하는 단단한 ’섀시(chassis)’가 되었다. 희소성(sparsity), 선형 어텐션, 메모리 증강, 다단계 추론, 확산 메커니즘 등 AI 분야의 모든 유망한 아이디어들이 트랜스포머라는 섀시 위에 볼트로 단단히 조여지고 있다. 2026년의 트랜스포머는 잔차 연결(residual stream) 위에서의 어텐션과 토큰 예측이라는 핵심 계약을 제외하면 2017년의 원래 모습과 거의 닮은 구석이 없다.

현실적인 미래는 ’완전한 대체’가 아니다. 바로 테세우스의 배다. 하이브리드화, 어텐션이 전체 레이어의 극히 일부로 축소되는 흐름, 확산 기반 디코딩, 바이트 레벨 입력 등이 더해져, 2030년에 우리가 여전히 “트랜스포머”라고 부를 무언가는 2017년의 DNA를 품고 있으면서도 당시의 연구자들은 결코 알아볼 수 없는 완전히 새로운 형태를 띠게 될 것이다.

이 분야는 정체되어 있지 않다. 끊임없이 복리로 진화하고 있다.