오늘 200포인트를 넘긴 6개의 이야기는 명확히 두 진영으로 나뉜다. AI 시대가 실제로 구동되는 기반 인프라를 구축하는 사람들과, 판 전체가 미쳐 돌아가고 있다고 생각하는 사람들이다. 그리고 두 진영 모두 옳다.
후지쯔, 일본산 차세대 CPU ‘FUJITSU-MONAKA’ 발표
473 points · Fujitsu
후지쯔의 144코어 Armv9.3-A 서버 CPU가 마침내 출시 일정을 확정했다. 독립형 프로세서의 전 세계 판매는 2026년 11월 일본 및 유럽 시장의 1U/2U MONAKA 서버와 함께 시작되며, 2027년 4월부터 공급이 본격 확대된다. 패키징 방식이 대단히 흥미롭다. 연산 다이는 2nm(TSMC N2P) 공정으로 제작되지만, 최하위 레벨 캐시(LLC) 전체는 별도의 5nm 다이에 배치되어 코어 다이와 하이브리드 본딩을 통해 페이스투페이스(face-to-face)로 적층된다. 세 번째 5nm 다이는 실리콘 인터포저를 통해 I/O를 처리한다. 후지쯔가 2nm 실리콘의 면적을 전체 다이 면적의 30% 미만으로 억제한 것은, 면적이 거의 줄어들지 않는 SRAM에 값비싼 2nm 단가를 지불하지 않으면서도 2nm 제품을 시장에 내놓기 위한 전략적 선택이다.
SKU는 두 가지다. 베이스 클럭 2.1GHz의 350W 공랭식 모델과 베이스 2.9GHz의 500W 수랭식 모델이며, 둘 다 부스트 3.8GHz까지 올라가고 144코어를 모두 활성화한다. 메모리는 12채널 DDR5-8800을 지원하고, 소켓당 96레인의 PCIe 6.0 및 CXL 3.0을 제공하며, 칩은 18코어 8개 노드, 36코어 4개 노드, 또는 단일 144코어 도메인으로 유연하게 구성할 수 있다. 후지쯔는 코어를 공칭 전압보다 약 30% 낮게 구동하는 초저전압 동작을 통해 350W 전력 한도 내에 144코어를 묶어둘 수 있었다고 밝히며, 350W 모델 기준 4,355 GFLOPS(DGEMM)와 69.7 TOPS(INT8)의 성능을 제시했다.
이제 의구심을 가질 차례다. 후지쯔는 비교 대상 프로세서나 구성, 독립적 벤치마크 결과도 공개하지 않은 채 “기타 CPU” 대비 2배의 AI 추론 처리량, 약 50%의 TCO 절감, 최대 80% 낮은 냉각 전력을 주장한다. 제시된 DGEMM 및 STREAM 수치는 실제 측정이 아닌 후지쯔의 추정치이며, 회사 외부에서 테스트되기 전까지는 아무런 의미도 갖지 못한다. 설계상 명백한 퇴보도 있다. 코어가 후가쿠(Fugaku)를 구동했던 A64FX의 512비트 SVE보다 좁은 두 개의 256비트 SVE2 유닛을 채택했다는 점이다. 후지쯔가 밝힌 이유는 코어 크기와 비용 절감인데, 데이터센터 범용 부품으로는 타당할지 몰라도 회사의 유서 깊은 HPC 계보로 보면 발전이 아닌 후퇴다. “일본산(Made in Japan)“이라는 수식어도 뜯어볼 필요가 있다. 연산 다이는 대만 TSMC에서 제조되며, 주권형이라는 주장은 최첨단 실리콘이 어디서 생산되는가가 아니라 칩이 조립되고 추적되는 곳(가사시마 공장)에 기반한다. 이는 방위 조달에서 공급망 추적성 측면에서는 의미가 있지만 팹(fab) 독립성과는 거리가 멀며, 보도자료는 이 둘을 은근슬쩍 혼동하도록 내버려둔다.
MONAKA가 대량 양산에 들어가는 2027년이 되면, 144코어는 Graviton5의 192코어나 512코어로 향하는 Ampere의 로드맵 앞에서 중간 수준에 머물게 될 것이다. 이 칩의 진정한 차별점은 별도 다이에 올린 캐시 적층 구조, 메모리 대역폭, CXL 풀링, 그리고 엔비디아와의 NVLink Fusion 통합에 있다. 이는 업계가 어디로 향하고 있는지 보여주는 진짜 힌트다. 일본의 차세대 플래그십 슈퍼컴퓨터 계획인 FugakuNEXT조차 GPU를 중심에 두고 있다.
Hister: 방문한 웹페이지와 보관 중인 파일을 위한 프라이빗 검색 엔진
387 points · GitHub
SearXNG의 제작자인 asciimoo가 내놓은 Hister는 이전 프로젝트와는 결이 다르다. 타인의 검색 엔진 결과를 중계하는 대신, 사용자가 방문한 웹페이지와 지정한 로컬 디렉터리의 전문(full-text) 색인을 직접 구축한다. 이후 127.0.0.1:4433의 웹 UI, 터미널 UI, CLI, 혹은 AI 어시스턴트가 호출할 수 있는 MCP 서버를 통해 검색할 수 있다. Firefox 및 Chrome 브라우저 확장 프로그램이 웹 서핑 중 페이지 콘텐츠를 로컬 서버로 전달하며, 브라우저 방문 기록을 가져오거나 원하는 사이트를 크롤링할 수도 있다. Go 언어로 작성되었고 AGPL-3.0 라이선스이며, GitHub 스타 4,200개를 기록 중이다. 단일 바이너리와 명령어 한 줄로 즉시 실행할 수 있다.
단순한 주말 토이 프로젝트를 넘어서는 두 가지 이유가 있다. 첫째, 번거롭지만 중요한 기본기를 제대로 갖췄다. 필드 필터, 구문 검색, 와일드카드, 부정(negation), 결과 우선순위, 공유 서버에서의 멀티유저 분리를 지원하며 기본 설정에서는 텔레메트리나 클라우드 의존성이 전혀 없다. 둘째, MCP 인터페이스가 대단히 강력한 유스케이스를 제공한다. 에이전트가 열린 웹 전체를 뒤지는 대신 사용자가 직접 읽었던 기록과 파일의 전문 색인을 검색할 수 있다는 것은 본질적으로 다르다. 그럴듯한 답변을 지어내는 대신, 사용자가 실제로 확인했던 출처를 기반으로 검증 가능한 답변을 내놓기 때문이다.
다만 프라이버시 주장은 겉보기보다 범위가 좁다. 선택 기능인 시맨틱 검색은 사용자가 설정한 임베딩 엔드포인트로 문서 텍스트를 전송하는 방식으로 동작한다. 이 기능을 켜는 순간, README가 자랑하던 ’서드파티 의존성 배제’는 무색해진다. 또한 저장 데이터 암호화(encryption at rest)에 대한 언급이 없는데, 한 개인이 읽은 모든 텍스트의 완전한 색인은 공격자에게 대단히 매력적인 표적이다. 기존 도구와의 비교도 필요하다. Recoll이나 DocFetcher가 이미 로컬 전문 검색을 제공하고 있고 Khoj도 인접 영역에 있다. Hister의 진정한 강점은 검색 엔진 자체보다 브라우저 우선 수집 기능과 MCP 연동에 있다. 구글 대체재가 아니며 그런 척하지도 않는다. 기억할 수 있는 양보다 훨씬 더 많이 읽는 이들을 위한 일종의 ’외장 기억 보조 장치’다.
GLM은 어떻게 자체 추론 인프라를 구축했는가
349 points · Z.ai
’재귀적 자기 개선’이라는 자극적인 제목 아래 가려져 있지만, 올해 나온 엔지니어링 기록 중 손에 꼽힐 만큼 구체적이고 실질적인 글이다. 지푸(ZhiPu)는 10만 개 이상의 중국산 AI 가속기로 구성된 클러스터에서 GLM-5.3-Flash를 위한 프로덕션 추론 환경을 밑바닥부터 구축했다. 그 하드웨어로는 누구도 시도해보지 않은 규모였다. 제약 조건은 가혹했다. 엔비디아 제품보다 적은 온칩 메모리와 대역폭, 미성숙한 소프트웨어 생태계, 불완전한 커널 지원, 리버스 엔지니어링해야 했던 문서들이 발목을 잡았다. 결과로 탄생한 스택은 공격적인 메모리 기법의 집합체다. 선형 어텐션과 LM 헤드를 위한 노드 내 텐서 병렬화, ReplaySSM(연산량으로 대역폭을 절약하는 기법), W8A8 양자화, INT8/FP8/BF16에 걸친 혼합 정밀도 KV 캐시, 레이어 분할, 그리고 인코드-프리필-디코드(Encode-Prefill-Decode) 분리형 아키텍처다. 이를 통해 종단간 서빙 처리량을 약 3배 끌어올렸으며, 가동률과 토큰당 비용이 주류 GPU와 견줄 만한 수준에 도달했다고 주장한다(구체적 벤치마크는 미공개이므로 측정치가 아닌 목표치로 보아야 한다).
여기서 진짜 배울 점은 커널 최적화 작업이 아니다. 바로 에이전트를 실질적으로 유용하게 만든 메커니즘이다. 지푸는 GLM-5.3 기반의 ’인프라 에이전트’가 작업의 상당 부분을 수행했다고 밝히는데, 에이전트의 효과는 모델의 코딩 실력 자체보다 시스템이 원인 추적 가능한(attributable) 피드백을 제공할 수 있는가에 달려 있었다. 로컬에서, 저비용으로, 객관적으로, 특정 레이어에 귀속시킬 수 있는 피드백 환경 말이다. 글에 소개된 세 가지 사례 연구는 대단히 구체적이다. KDA 커널의 컨텍스트 병렬화 경로가 FP32 입력에 대해 tl.dot 내부에서 조용히 TF32로 계산하여 긴 컨텍스트에서 오차가 누적되던 문제를 발견하고 input_precision="tf32x3"로 수정해 Flash Linear Attention 상위 프로젝트에 머지시켰다. KV 전송이 DeepEP 디스패치와 전혀 겹치지 않던 문제는 노드 내 경로가 파이썬 GIL을 쥐고 있었기 때문이었고(노드 간 코드는 이미 GIL을 해제하고 주석까지 달려 있었다), GIL을 해제함으로써 프리필 및 전송 오버헤드를 20% 이상에서 1% 미만으로 줄였다. 디코드 커널이 V 차원을 따라 타일링되면서 동일한 FP32 정규화 및 게이팅을 4번 반복하던 문제는 타일을 하나의 스레드 블록으로 합치고 중간값을 레지스터에 상주시켜 기존 버전 대비 1.71배 성능 향상을 얻어냈다. 상위 프로젝트에 실제로 반영된 진짜 엔지니어링이다.
다만 이것을 ’재귀적 자기 개선’이라 부를 수는 없다. 글 본문이 제목보다 훨씬 정직해서 다행이다. 엔지니어들이 목표와 시스템 경계를 정의하고, 피드백 환경을 구축했으며, 수치적 의미론이나 동시성, 프로덕션 위험과 관련된 모든 변경 사항을 직접 검토했다. 에이전트는 제안하고, 구현하고, 테스트했을 뿐이다. 적응에서 프로덕션까지 2주 미만, 3배 처리량, 10만 가속기라는 숫자는 내부에 모델을 품은 ’매우 잘 짜인 CI 루프’를 설명할 뿐, “모델이 시스템을 최적화하고 시스템이 모델을 구동한다”는 거창한 주장과는 거리가 있다. 또한 에이전트 엔지니어링의 현재 병목이 모델 성능이 아니라 계측(instrumentation)의 품질에 있음을 보여주는 가장 설득력 있는 논거이기도 하다. 마지막으로, 보안 파트너들이 이 모델을 사용해 수천 개의 실제 취약점을 발견했다고 태연하게 언급하는 대목은 아래 이어지는 글이 그토록 분노하는 현실과 정확히 맞닿아 있다.
1년간의 후원으로 이뤄낸 서보(Servo)의 개발 여정
337 points · Servo
리눅스 재단 유럽(Linux Foundation Europe) 산하에 있는 브라우저 엔진 서보(Servo)가 오픈컬렉티브와 깃허브 후원금을 통해 오랜 메인테이너인 조시 보먼-매튜스(Josh Bowman-Matthews)에게 1년간 파트타임 인건비를 지원했다. 그의 회고록은 거의 의도적일 정도로 화려함과는 거리가 먼데, 바로 그 점이 핵심이다. 12개월 동안 8명의 신규 메인테이너 지명, 1,150개의 풀 리퀘스트 리뷰, 신규 기여자를 위해 특별히 등록된 114개의 이슈 중 92% 해결, 빌림 위험(borrow hazards) 및 실험적 기능, 기여할 일감 찾기, 불안정한 테스트 진단에 관한 신규 문서 작성 등이 이루어졌다. 또한 간헐적인 가비지 컬렉션 패닉을 해결하고 망가진 window.open 동작을 찾아내며 수많은 불안정 테스트를 안정화한 대규모 JS 엔진 연동 재작성을 지원했고, 다른 기여자의 연구 지원금 제안서 승인을 도왔다.
브라우저 엔진을 실제로 살아 숨 쉬게 만드는 동력이 무엇인지 궁금했다면 바로 이것이다. 영리한 아키텍처 블로그 글이 아니라, 리뷰 처리량, 메인테이너 육성 파이프라인, 그리고 타인의 기여가 프로젝트에 안착할 수 있도록 돕는 전담 인력의 존재다. 92%의 신규 기여자 이슈 해결률은 가장 돋보이는 숫자다. 자원봉사 인프라에서 가장 흔한 실패 패턴인 ’이슈 방치’를 막고, 신규 참여자들의 피드백 루프를 적극적으로 닫아주었음을 의미한다.
물론 뼈아픈 질문들은 회고에서 빠져 있다. WPT(Web Platform Tests) 통과율 수치도, 임베딩이나 도입 통계도, 총 모금액도, 이 역할이 앞으로 유지될지에 대한 언급도 없다. 서보의 차별점은 애플리케이션에 웹 기술을 임베딩하기 위한 경량 엔진이라는 점인데, 그 주장을 증명하려면 서보를 내장해 실제로 출시된 상용 제품이 필요하다. 한 가지 주목할 만한 디테일은 그가 작성한 문서 중에 프로젝트의 AI 정책이 포함되어 있다는 점이다. AI 기능이 전혀 없는 브라우저 엔진조차 이제 AI 생성 기여에 대한 명문화된 입장을 마련해야 한다. 그렇지 않으면 기여 함의가 순식간에 마비되기 때문이다.
CCC, 모든 ’모범 시민’을 40C3로 초대하다
313 points · CCC
카오스 컴퓨터 클럽(Chaos Computer Club)이 제40회 카오스 커뮤니케이션 콩그레스(40C3)의 참가 신청(CFP)을 시작했다. 2026년 12월 27일부터 30일까지 함부르크 전시장(Hamburg Exhibition halls)에서 개최되며, 올해의 모토는 “모범 시민(Model Citizens)“이다. 강연, 예술, 펑크, 음악 분야의 제안을 받는다. 함부르크로의 장소 이전은 올해 운영상 가장 큰 변화다. 주최 측은 장소 변경으로 행사 규모를 확장할 공간이 마침내 확보되었다고 밝혔는데, 자원봉사자로 운영되고 외부 자본 지원을 받지 않는 콘퍼런스 입장에서 이는 앞으로 3개월의 준비 과정에 따라 기회가 될 수도, 물류 대란이 될 수도 있다.
프레이밍은 노골적으로 정치적이며 에두르는 법이 없다. 공유된 미래를 향한 연대가 강자가 약자에게 자신의 관점을 강요하는 권위주의 모델에 자리를 내주고 있고, 자유주의 세력은 새로운 것을 만들기보다 수세에 몰려 방어만 하고 있으며, 콩그레스 그 자체가 대안적 모델—다름을 자산으로 대하고 낯선 것을 영감으로 삼는—이라고 역설한다. 모토는 AI의 “모델 시민(훈련된 모델)“을 꼬집는 이중적 언어유희이기도 하다.
이러한 수사를 어떻게 받아들이든, 참가자들이 행사를 단순히 소비하는 것이 아니라 능동적으로 만들어간다는 구체적인 사실만큼은 지난 39년간 굳건히 입증되어 왔다. 콩그레스는 16,000명 이상의 방문객이 모이는 유럽 최대의 비상업적 해커 콘퍼런스이며, 이곳의 강연 프로그램은 훗날 주류가 된 수많은 도구와 정책 담론의 씨앗을 뿌렸다. 행사의 진정한 가치는 끝난 뒤에 무엇이 남는가로 평가받으며, 이 행사는 그에 대한 분명한 실적을 갖고 있다. 인간을 플랫폼의 소유물로 전락시키지 않는 시스템 구축에 대해 하고 싶은 말이 있다면 마감은 지금이며, 행사장에는 자리가 넉넉하다.
다들 제정신이 아니다
249 points · netmeister.org
얀 샤우만(Jan Schaumann)의 글은 거친 일갈이며, 이번 세트에서 가장 많은 댓글이 달린 글이다. 현재 엔지니어링 커뮤니티의 분위기를 단적으로 보여준다. 핵심 논지는 이렇다. “토큰”이 카지노 칩처럼 쓰이고 아무도 투자 대비 수익(ROI)을 증명할 필요가 없어지자, 모든 기업이 저작권 세탁, 로그인 사용자 대상 CSAM 생성 기능, 군사 표적 지정, 집 근처에는 누구도 원치 않는 전력 및 물 낭비 등 AI의 부작용을 “윤리는 제쳐두고” 밀어붙이고 있다는 것이다. 한편에서는 엔지니어링 배경도 없는 사람들이 에이전트로 뒤덮인 홈랩에서 세상을 바꿀 솔루션을 떠벌리고 있고, 세상의 모든 글은 링크드인 인플루언서 식의 조악한 문체로 획일화되었다.
가장 강력하고 반증 가능한 대목은 AI 취약점 탐지 프로그램에 대한 비판이다. 앤트로픽과 오픈AI는 자기네 모델이 얼마나 위험한지 경쟁하듯 과시해왔고, 자칭 업계 리더라는 이들은 정체불명의 프로젝트에 이름을 올리거나 공개 서한에 서명했다. 그 프로그램들은 수십 명의 시니어 보안 엔지니어를 수개월간 갈아 넣으며 기존 우선순위를 뒤흔들었고, 취약점 관리 파이프라인에 수천 건의 탐지 결과를 쏟아부었으며(조직당 수백만 달러가 소요되었다), 정작 상위 프로젝트에 보고된 것은 극히 일부에 불과했다. 그의 결론은 이렇다. 취약점을 찾고 고치는 것은 애초에 보안의 병목이 아니었기 때문에 우리는 조금도 더 안전해지지 않았다. 진짜 병목은 패치를 적용하는 것이다. 패키지를 최신 상태로 업데이트하는 일 말이다. 그의 통찰은 대체로 정확하며, 그가 제시한 반사실적 가정은 뼈아프다. 그 천문학적인 비용을 패키지 단위의 정밀한 자산 인벤토리 구축, 자동 업데이트 인프라, 가동 시간 30일 초과 시 강제 재부팅, 공격 표면 전수 조사에 썼더라면 또 다른 에이전트 하네스를 만드는 것보다 훨씬 더 실질적인 변화를 만들어냈을 것이다.
이어 그는 업계 자체의 인지 과정으로 칼끝을 돌린다. 글의 분노가 진짜 빛을 발하는 지점이다. AI가 취약점을 찾고, AI가 패치를 작성하고, AI가 결과물인 풀 리퀘스트를 리뷰하며, “인간의 개입(human in the loop)“은 고무도장에 불과하다. 주기가 반복될 때마다 하위 시스템을 온전히 이해하는 인간은 하나씩 사라진다. 복잡한 시스템은 복잡한 방식으로 고장 나며, 디버깅은 코드를 작성하는 것보다 한 차원 더 어렵다. 그리고 운영자 자신조차 불투명한 컴포넌트들로 이루어진 분산 시스템을 디버깅하는 것은 어려운 문제가 아니라 불가능한 문제다. 글은 균형 잡혀 있지 않고 애초에 그럴 의도도 없다. 필자는 업무 시간의 75%를 AI에 쏟고 있다고 순순히 인정하는데, 이는 논증이자 일종의 번아웃 고백록이기도 하다. 어조는 걷어내고 병목 분석에 집중해보라. 그리고 위에서 소개한 GLM 글과의 불편한 교집합을 주목하라. 그가 묘사한 에이전트 루프를 만들고 있는 바로 그 기업들이, 모델이 자체 인프라를 구축하는 데 도움을 주었다며 이를 희소식으로 포장하고 있다.
맥락 읽기
오늘 프론트페이지에서는 두 가지 진실이 동시에 작동한다. AI 시대의 배관은 실리콘 레벨부터 다시 깔리고 있다. 2nm 공정의 비용 압박을 피하기 위해 별도 다이에 캐시를 적층한 일본 CPU, 다른 선택지가 없어 10만 개의 자국산 가속기 위에서 프로덕션 트래픽을 처리하는 중국 모델 스택, 타인의 API 대신 내 컴퓨터 안에 에이전트의 검색 기능을 내장한 로컬 색인 도구 등이 그렇다. 그리고 이 배관을 까는 거의 모든 이들이 마음속 깊은 불안을 안고 있다. 후지쯔의 수치는 비교 기준이 없고, 지푸의 화려한 자기 개선 헤드라인은 이성적인 인간들이 통제하는 CI 루프로 귀결되며, 샤우만은 ROI를 따져본 사람을 단 한 명도 찾지 못한다.
기술 주권이라는 테마는 세 가지 이야기 속에서 절반의 약속만을 지킨 채 맴돈다. MONAKA는 “일본산”이지만 대만에서 위탁 생산된다. GLM의 가속기 스택은 엔비디아로부터의 진정한 독립을 이뤄냈지만 엔비디아 대비 토큰당 비용 우위는 입증된 것이 아니라 주장에 불과하다. Hister는 설정에서 외부 임베딩 엔드포인트를 켜기 전까지만 진정한 로컬이다. 각각은 눈에 보이는 의존성을 보이지 않는 의존성과 맞바꾸었으며, 마케팅은 그 뒷면을 결코 말해주지 않는다.
또 다른 연결고리는 피드백이다. 서보의 1년은 오픈소스 프로젝트를 지탱하는 힘이 천재적인 재능이 아니라 리뷰 처리량, 메인테이너 육성, 그리고 신규 참여자를 위한 피드백 루프의 완결(신규 이슈 해결률 92%)에 있음을 보여준다. 지푸의 1년 역시 에이전트에게 동일한 원칙이 적용됨을 입증한다. 모델은 특정 변경이 특정 지표를 악화시켰다는 사실을 얼마나 저렴하고 정밀하게 전달받을 수 있는가에 비례하여 유용했다. 반면 샤우만의 한탄은 업계가 정반대의 방향, 즉 더 많은 생성, 더 많은 자동화, 더 적은 원인 규명, 더 적은 이해에 투자해왔다는 점을 찌른다. 이 두 갈래 길의 차이는 낙관론이냐 비관론이냐의 문제가 아니다. 피드백 루프를 정밀하게 계측하려는 노력을 기울였는가, 그리고 시스템을 온전히 이해하는 인간이 여전히 그 안에 남아 있는가의 문제다.