구글 검색의 죽음, 그 뒤에 올 더 끔찍한 것

810 points · The Walrus

바스 베드나(Vass Bednar)가 The Walrus에 기고한 글은 AI가 오픈 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있다고 주장한다. 글의 시작점은 흥미롭다. 구글의 AI 오버뷰(AI Overviews)가 일몰 시간처럼 결정론적이고 공개된 정답이 있는 질문에조차 환각을 일으키고 있다는 것이다. 검색 시스템이 원본 출처를 안내하는 대신 스크래핑한 콘텐츠를 짜깁기해 합성 답변을 내놓기 때문이다. 야외 행사를 계획하던 사용자들이 검색 경험을 개선해 준다던 시스템으로부터 자신만만하게 틀린 답을 받아 들고 있다.

더 거시적인 논점은 구글의 AI 요약이 애초에 웹을 색인할 가치가 있게 만들었던 보상 체계 자체를 무너뜨리고 있다는 점이다. 퍼블리셔는 유입 트래픽을 잃고, 창작자는 출처 표기를 잃으며, 사용자는 검증된 출처 대신 지식의 확률적 근사치를 얻게 된다. 기사는 이를 캐나다 지역 언론사들이 추천 트래픽 증발을 지켜보는 로컬 미디어의 위기로 풀어냈지만, 이 역학은 전 세계적으로 동일하다. 정보 탐색을 독점해 온 검색 엔진이 사용자를 자신의 플랫폼 안에만 가두기로 결정할 때, 저널리즘과 독립 블로그, 전문 니치 레퍼런스 사이트가 겪는 파급 효과는 실존적 위기에 가깝다.

이 글이 들춰낸 불편한 진실이 있다. 인류 역사상 가장 방대한 지식 인프라를 구축해 놓고는, 그 문지기 역할을 자사 플랫폼 내 체류 시간 극대화가 핵심 수익 모델인 기업에 통째로 넘겨주었다는 사실이다. 제목에서 말하는 “그 뒤에 올 것”은 AI 네이티브 검색 스타트업들을 가리키지만, 진짜 걱정거리는 우리가 어떤 인터페이스를 쓰느냐가 아니다. 요약의 대상이 되는 원본 콘텐츠가 앞으로도 계속 존재할 수 있느냐는 문제다.


Needle 2: 스마트폰과 웨어러블, 스마트홈을 위한 14MB 에이전트 LLM

495 points · Cactus Compute

캑터스 컴퓨트(Cactus Compute)가 도구 호출(tool calling), 기기 제어, 구조화된 데이터 추출을 지원하는 4,500만(45M) 파라미터 크기의 오픈 모델인 Needle 2를 공개했다. 모델 전체가 단 14MB짜리 단일 바이너리로, 28MB RAM 위에서 구동된다. 자체 Simple Attention Network 아키텍처 기반으로 설계되었으며, Cactus Quants를 통해 CQ2-bit로 압축되었고, 외부 런타임 의존성 없이 자체 추론 엔진을 내장하고 있다.

벤치마크에서 Needle 2는 fp16으로 구동되는 5배에서 70배 더 큰 모델들(FunctionGemma 270M, LFM2.5 230M, Apple FM)을 상대로 2비트 정밀도로 경쟁하며 호각을 다툰다. 발표된 처리량은 라즈베리 파이 5에서 디코드 초당 500토큰, VR 헤드셋(Meta Quest 3S, Apple Vision Pro)에서 초당 4001,500토큰, 200달러 이하 저가 스마트폰에서도 초당 300700토큰에 달한다. 최대 세션 RAM 사용량이 약 28MB에 불과해 ESP32-S3 같은 최신 마이크로컨트롤러에서도 실행 가능한 사정권에 들어온다.

데모는 인상적이다. 다단계 도구 라우팅, 기기 제어, 양식 자동 완성, 주제를 벗어난 질의 거부까지 브라우저 내 WebAssembly로 구동된다. 관건은 14MB 모델의 “도구 호출”이 프로덕션 환경에서 신뢰할 수 있는 구조화된 출력을 보장하는지, 아니면 통제된 데모 환경만 통과하는 수준인지다. 인용한 벤치마크(Mobile-Actions, BFCL)는 합리적인 선택이지만, 실제 환경의 에이전트 루프는 평가 스위트보다 훨씬 복잡하고 지저분하다. 그럼에도 크기와 처리량 사이의 트레이드오프는 진정 혁신적이다. 임베디드 시스템용 온디바이스 AI를 구축하고 있다면 눈여겨볼 만하다. 대안은 270MB가 넘는 모델을 탑재하거나 로컬 추론을 아예 포기하는 것뿐이기 때문이다.


잉글랜드, C형 간염 퇴치를 목전에 두다

427 points · BBC

잉글랜드가 공중보건의 위협으로서 C형 간염을 퇴치한 세계 최초의 국가 중 하나가 될 궤도에 올랐다. 확인된 확진자의 80%를 치료하겠다는 목표는 이미 달성되었고, 바이러스로 인한 사망자는 지난 10년 동안 36% 감소하여 WHO의 2030년 퇴치 기준선에 거의 도달했다. 최신 항바이러스제는 8주에서 12주간의 경구제 복용만으로 환자의 95% 이상을 완치시킨다.

이 프로그램의 성공은 공격적인 환자 발굴에 힘입은 바 크다. 응급실 검사, 노숙인과 주사제 투약자에 대한 아웃리치, 교도소 내 옵트아웃 선별 검사 등이 포함된다. 전통적인 의료 체계가 일상적으로 놓쳐온 취약 계층이다. BBC 기사는 잉글랜드가 대부분의 비교 대상 국가들을 앞서고 있다고 언급하는데, 이는 잉글랜드의 비범함이라기보다 기술적으로 해결 가능한 문제 앞에서 대부분의 국가가 얼마나 무력하게 대처해 왔는지를 방증한다.

300개가 넘는 댓글은 이번 소식이 사람들에게 깊은 울림을 주었음을 보여준다. C형 간염 퇴치는 성공했을 때 눈에 띄지 않는 공중보건의 성취다. 생기지 않은 간암에 대해 아무도 축배를 들지 않기 때문이다. 여기서 얻는 더 큰 교훈은 명확하다. 진정으로 효과적인 치료법(직접 작용 항바이러스제는 현대 의학의 기적이다)과 체계적인 선별 인프라가 결합할 때, 질병 퇴치는 현실이 된다. 병목은 결코 과학이 아니었다. 가장 손닿기 어려운 환자들에게 다가가기 위한 물류와 정치적 의지의 문제였을 뿐이다.


H3-Metal: 애플 실리콘을 위한 네이티브 MiniMax-H3 추론 엔진

405 points · antirez/h3.c

Redis의 창시자 살바토레 산필리포(Salvatore Sanfilippo)가 이번에는 애플 GPU 기반의 네이티브 비디오 생성 작업에 뛰어들었다. 그는 애플 실리콘에서 MiniMax의 H3 모델을 구동하는 네이티브 추론 엔진인 h3-metal을 공개했다. 이 프로젝트는 텍스트 프롬프트로부터 비디오와 오디오를 생성하며, 시작/끝 프레임 조건 지정과 순서화된 레퍼런스 이미지를 지원하고, 맥 하드웨어의 Metal을 통해 직접 동작한다.

빌드는 단계별 수직 슬라이스로 구조화되어 있다. 결정론적 메타데이터를 먼저 구성한 뒤, Metal 블록 동등성, 프롬프트 인코딩, 프롬프트-투-비디오/오디오, 프레임 조건 지정을 차례로 구현했다. 현재 상태는 이 모든 과정이 엔드투엔드로 동작하며, M3 Max와 M5 Max를 위한 지속적인 최적화가 진행 중이다. 대화형 CLI 세션을 통해 비디오를 생성하고, 시드를 설정하며, 프레임 수를 조정하고, 레퍼런스 이미지를 연결할 수 있다. 독점 모델의 추론 경로를 리버스 엔지니어링한 1인 프로젝트치고는 놀라울 정도로 정교한 개발자 경험을 제공한다.

이 프로젝트의 진정한 의미는 MiniMax H3 자체보다 그 패턴에 있다. 세계 정상급 시스템 프로그래머가 중국 AI 기업의 비디오 모델을 애플 하드웨어에서 네이티브로 돌리는 데 시간을 쏟고 있다는 사실이다. 추론 레이어가 상품화될 때 어떤 일이 일어나는지 보여주는 단적인 사례다. 흥미로운 작업의 중심은 특정 실리콘 위에서 속도를 극대화하는 쪽으로 이동하고 있다. 4만 2천 줄에 달하는 README 역시 그의 진지한 문서화 규율을 엿보게 한다.


독점 LLM API에서 추론 과정(Reasoning Trace)을 탈취하는 법

348 points · Stolen Thoughts

한 연구팀이 앤트로픽, 오픈AI, 구글의 암호화된 사고의 연쇄(Chain-of-Thought) 추론 경로를 2단계 API 공격을 통해 평문으로 복원할 수 있음을 입증했다. 공격 방식은 다음과 같다. 프론티어 모델(예: Claude Opus)에서 암호화된 추론 경로를 가져와 동일 제공자의 하위 계열 모델에 재전송한 다음, 해당 하위 모델을 탈옥시켜 상위 모델의 숨겨진 추론을 복원하는 것이다. 상위 모델을 직접 공격하거나 디스틸레이션 방지 장치를 건드릴 필요조차 없다.

연구진은 이 암호화된 추론 블록이 세션, 사용자, 모델 전반에 걸쳐 재사용(replay) 가능하다는 점을 보여준다. 이 공격은 추론 경로의 “암호화”가 진정한 암호화라기보다는 난독화에 가깝다는 취약점을 파고든다. 동일한 토크나이저와 추론 포맷을 공유하는 관련 모델에 입력으로 밀어 넣을 수 있기 때문이다. 거기서 하위 모델에 해당 추론을 “이어 나가라”거나 “설명하라”고 프롬프트를 주면 실질적으로 복호화가 이루어진다.

추론 능력을 중심으로 경쟁 우위의 해자(moat)를 쌓아온 이들에게 이는 심각한 발견이다. 동일 라인업의 더 저렴한 모델 API 접근 권한을 구매하는 것만으로 사고 과정을 추출할 수 있다면, 추론 경로는 영업 비밀이 아니라 구멍 뚫린 추상화에 불과하다. 논문은 3대 주요 제공업체 모두의 구체적인 모델명을 명시하고 있다. 실질적인 시사점은 명확하다. 클라이언트에게 암호화된 CoT를 제공하는 행위는 곧 경쟁사에게 자사의 추론을 통째로 넘겨주는 것과 다름없다는 뜻이다. 133개의 댓글이 달린 HN 토론은 이것이 “절도”인지 아니면 API가 자발적으로 반환한 내용을 단순히 관찰한 것인지를 두고 예상대로 뜨겁게 달아올랐다.


Chicken Scheme 6.0

291 points · code.call-cc.org

오랜 기다림 끝에 Chicken Scheme 6.0 메이저 버전이 출시되었다. 주요 변경 사항은 내부 문자열 표현이 UTF-8로 전면 전환되어 완전한 유니코드를 지원하며, 모든 R7RS-small 모듈이 코어 시스템에서 사용 가능해졌고, 기존 blob 타입을 대체하여 R7RS 호환 연산을 지원하는 bytevector가 도입되었다는 점이다. 기본적으로 Latin-1 문자열에 머물러 있던 마지막 주류 Scheme 구현체 중 하나였던 Chicken으로서는 중대한 현대화다.

그 외 주목할 만한 변화로는 프로세스 관리가 이제 원시 PID 대신 프로세스 객체를 반환하고, 파일 잠금에 스레드 안전한 flock(2)을 사용하며, 포트 생성자가 키워드 인자를 지원한다는 점이다. make-binary-input-port와 make-binary-output-port의 추가도 실용적이다. 이전에는 바이너리 I/O 처리가 꽤나 까다로웠기 때문이다. 문자열 로케이티브(locatives)도 바이트 단위가 아닌 코드 포인트 단위로 인덱싱되는데, 이는 유니코드를 인식하는 시스템에 걸맞은 올바른 동작이다.

Chicken은 언제나 독특한 입지를 지켜왔다. C로 컴파일되고, 공유 라이브러리로 배포되며, C 생태계와 매끄럽게 맞물리는 Scheme이다. 6.0 릴리스는 임베딩에 유용한 고유의 컴파일 모델을 해치지 않으면서 현대 프로그래밍 언어의 기본 기대치(유니코드, R7RS 준수)를 충족시켰다. 이 소식에 찬대표를 던진 291명의 사람들에게는 개별 기능 하나하나보다, 오랫동안 사랑받아 온 니치 언어가 여전히 살아 숨 쉬며 의미 있는 릴리스를 선보이고 있다는 사실 자체가 더 소중했을 것이다.


애플 실리콘 VM: llama.cpp로 LLM 추론 속도 11~16배 끌어올리기

254 points · trycua/cua

Cua 팀(macOS 가상화 스택 개발사)이 애플의 Virtualization.framework가 게스트 가상머신에 지나치게 보수적인 GPU 기능 프로필을 전달하고 있음을 밝혀냈다. 구체적으로 최대 32KB 스레드 그룹 메모리와 SIMD-그룹 매트릭스를 지원하지 않는 Apple Family 5 시절의 프로필을 보고하는 식이다. 이로 인해 호스트 GPU가 최신 경로를 지원함에도 불구하고 llama.cpp는 더 느린 Metal 코드 경로를 탈 수밖에 없었다. 이들의 해결책은 기능 쿼리를 가로채 정확한 값을 반환하는 프로세스 스코프의 Metal 기능 심(shim)이다.

결과는 극적이다. M1 Ultra 환경에서 TinyLlama 1.1B 기준으로 프롬프트 처리 속도는 순정 VM의 431 tok/s에서 언락 후 4,786 tok/s로 11배 향상되어 베어메탈 성능의 98%에 도달했다. 토큰 생성 속도는 16배 빨라졌다. Gemma 4 12B QAT의 경우 언락된 VM이 베어메탈 프롬프트 속도의 99.59%를 기록했다. Meta의 Muse Glimmer 30B조차 프롬프트 처리와 생성에서 각각 7.5배, 8.8배의 성능 향상을 보였다.

영리한 점은 이것이 실제 GPU 패스스루가 아니라는 사실이다. 여전히 애플의 준가상화(paravirtualized) 가상 GPU 경로를 통해 동작한다. 심은 llama.cpp에 하드웨어가 실제로 지원하는 Metal 기능의 진실을 알려줄 뿐이며, 덕분에 보수적인 폴백 대신 최적의 커널을 선택하게 만든다. 이는 LLM 추론뿐 아니라 Metal 워크로드를 실행하는 모든 Virtualization.framework 사용자에게 영향을 미칠 만한 버그다. 다른 이들이 접근법을 검증하고 확장할 수 있도록 소스 코드도 공개되었다.


엔비디아의 위험한 도박

232 points · Stratechery

벤 톰슨(Ben Thompson)은 제이 쿡(Jay Cooke)과 노던 퍼시픽 철도 이야기로 글을 시작한다. 과도한 수수료가 개인 투자자들에게 점점 더 위험한 채권 판매를 부추겼고, 결국 1873년 공황으로 이어졌던 금융 스캔들이다. 엔비디아의 현재 위치와 맞닿아 있는 평행선이 바로 이 글의 중심 줄거리다. 성공 그 자체가 기업을 구조적으로 위험한 영역으로 밀어 넣는 유인을 만들어냈다는 분석이다.

Stratechery의 논점(유료 구독 글이므로 공개된 부분 기준)은 엔비디아가 중대한 전환점에 서 있다는 것이다. AI 가속기 시장에서의 지배력이 더 뛰어난 칩이 아니라, 자체 칩을 설계하는 고객사들(구글 TPU, 아마존 트레니엄, 마이크로소프트 마이아)과 엣지 기기, 스마트폰, 특화 하드웨어로 파편화되는 추론 시장에 의해 도전받고 있기 때문이다. 이에 대응해 소프트웨어 플랫폼, 네트워킹(Mellanox), 클라우드 서비스로 확장하는 엔비디아의 행보는 상품화(commoditization)를 우려하는 하드웨어 기업들이 역사적으로 보여준 수직 계열화 움직임과 정확히 궤를 같이한다.

232점이라는 점수는 톰슨이 엔비디아의 위험을 과장하고 있다고 보는 시각(여전히 막대한 매출 성장세를 구가 중이므로)과, 최대 고객이 곧 경쟁자가 될 때 마진은 필연적으로 꺾인다는 패턴을 알아보는 시각 사이의 팽팽한 관심도를 보여준다. 쿡 철도 비유는 적절하다. 엔비디아가 무너질 것이라는 뜻이 아니라, 현재 수준의 마진으로 AI 인프라를 판매하는 인센티브 구조 자체가 정확히 그 마진을 깎아내릴 경쟁자들을 끌어들이고 있기 때문이다.


맥락 읽기

오늘의 해커뉴스 프론트페이지는 인프라가 한계에 부딪히고 다양한 규모에서 재구축되는 이야기로 요약된다. The Walrus의 기사는 정보 인프라(구글 검색과 오픈 웹)가 자신이 탄생시킨 AI 시스템에 의해 속이 비어가는 현실을 보여준다. Needle 2와 h3-metal은 그에 맞서는 반작용을 상징한다. 각각 추론 인프라를 가장 작은 하드웨어로 밀어붙이고, 애플 실리콘으로 끌어내리는 시도다. Cua VM의 발견은 애플 자체의 가상화 인프라조차 사람들이 가장 중요하게 여기는 워크로드를 조용히 가로막고 있었음을 폭로한다.

탈취된 추론 경로 논문은 가장 뼈아픈 곳을 찌른다. 암호화된 사고의 연쇄가 경쟁 해자가 될 것이라는 가정을 무너뜨리기 때문이다. 자신의 추론을 더 저렴한 모델에 입력해 디코딩할 수 있다면, 앤트로픽과 오픈AI, 구글이 내세우는 “추론 경로 암호화” 기능은 지식재산 보호로 포장된 보안 연극에 지나지 않는다. 이는 해당 API 위에 비즈니스를 구축하는 모든 이들에게 즉각적인 파장을 미친다. 프롬프트 엔지니어링의 노하우가 관련 모델의 API에 접근할 수 있는 누구에게나 노출될 수 있기 때문이다.

Chicken Scheme 6.0과 잉글랜드의 C형 간염 퇴치는 조용한 승리의 소식이다. 니치 언어가 기초를 현대화하고, 공중보건 체계가 해결 가능한 문제를 마침내 실행에 옮겼다. 두 사례 모두 인프라에 대한 지루하고 꾸준한 노력(유니코드 지원이든 교도소 선별 검사이든)이 화려한 출시에 결코 뒤지지 않는 복리 효과를 낳는다는 사실을 일깨워준다. 한편 톰슨의 엔비디아 분석은 AI 골드러시의 곡괭이와 삽을 파는 기업 자체가 과도한 확장을 겪고 있는 것은 아닌지 묻는다. 그에 대한 답은 AI 인프라 수요를 철도 거품으로 보느냐, 아니면 진정한 패러다임 전환으로 보느냐에 달려 있을 것이다. 그리고 역사가 말해주듯, 진실은 대개 그 둘의 중간 어딘가에 있다.