오늘 아침 집계 구간에서 200점을 넘긴 스토리는 서른한 개다. 그중 열아홉 개가 새로 올라왔다. 나머지는 이 라운드업이 주말부터 추적해온 같은 항목들로, 프런트 페이지가 더는 표시하지 않는 순위에서도 여전히 점수를 쌓고 있다 — 최상위 항목은 1,980점에 1,184개 댓글이고, 나흘째 1위 자리를 벗어나지 않았다.

오늘 정말 읽을 가치가 있는 것은 단 하나, OpenAI의 수학 발표다. 이번 주 AI 관련 발표 가운데 검증 가능한 결과물을 함께 내놓은 유일한 사례이기 때문이다. 나머지는 전부 벤치마크 표이거나 제품 데모, 아니면 권한 이야기다.

수학에서의 AI 진전 공유 — 1,185 points

1,185 points · 1,339 comments · openai.com · HN discussion

OpenAI가 내부 프런티어 모델로 만들어낸 수학 결과물 묶음을 공개했다. GitHub 저장소에 프리프린트로 올렸고, 많은 증명을 Lean으로 형식화했다 — 컴퓨터가 어떤 증명이 실제로 증명인지 검사할 수 있게 해주는 언어다. 결과물당 평균 컴퓨트는 대략 ChatGPT Pro로 세 시간가량 사고한 분량이었고, 저장소에는 모델의 추론 요약 열 편과 문제를 몇 개나 시도했는지에 대한 통계가 들어 있다.

이 공개 묶음은 어느 연구소든 모델이 생성한 과학에 관해 공개한 것 중 가장 알찬 내용이다. 무엇이 다른지 짚어둘 가치가 있다. Lean 형식화는 검증 가능하고, 컴퓨트 추정치는 반증 가능하며, 실패한 시도가 성공 사례와 나란히 공개된다 — 이 장르에서는 표준 관행이 아니다. OpenAI는 출판 규범에 관해 프린스턴 고등연구소(Institute for Advanced Study)의 수학과 AI 자문 그룹과 상의했다고도 밝혔는데, 아마도 이 일에 관한 확립된 규약이 아무도 없기 때문일 것이다.

댓글 스레드에 따르면 결과물에는 Unique Games 추측과 바네트 추측(Barnette’s Conjecture)이 포함된다. Unique Games가 성립한다면 — 스레드의 반응은 다항시간 근사 이론의 상당 부분을 떠받치던 주춧돌을 이제 다시 배워야 한다는 것이다 — 이번 주에 발표된 그 무엇보다 큰 사건이다. AI든 아니든. 스레드의 회의론은 수학이 틀렸다는 게 아니라, 증명이 읽기에 어떤 모습인지에 관한 것이다. 24년 동안 바네트 추측에 수천 시간을 쏟은 한 댓글 작성자는 그 증명이 “언뜻 보면 접근 가능해 보인다”며, 해결됐다는 소식을 듣고 “왠지 아득하게 슬퍼진다”고 했다. 케빈 버자드(Kevin Buzzard)를 인용한 또 한 명은 진짜 전환점을 짚는다. 2020년 버자드는 현대 순수수학 전체를 동시에 이해한다면 얼마나 더 멀리 볼 수 있을까 물었는데, 육 년이 지난 지금 우리는 그 답을 알아가기 시작했다.

그러니까, 검증 가능한 결과물, 공개된 실패, 정직한 컴퓨트 수치, 이름이 있는 자문 기구. 이것이 나머지 업계의 릴리스 페이지가 보여줘야 할 모습이다. 그 어느 곳도 그렇게 보이지 않는다는 사실이 더 유용한 관찰이다.

Meta의 Muse는 사랑스러운 프라이버시/보안 대참사 — 385 points

385 points · 279 comments · techdirt.com · HN discussion

Muse는 Meta의 에이전트형 비서로, Jolly라는 이름의 애니메이션 아바타가 앞에 나선다. 레스토랑 예약, 고지서 납부, 장보기 주문을 대신 처리해준다는 게 판매 포인트다. 출시와 동시에 Mac 사용자를 염탐할 수 있는 제로데이 결함을 안고 나왔다. 자기 Facebook Marketplace 계정을 넘겨준 한 유튜버는 주식을 시세보다 낮게 팔리고 집 주소까지 유출됐다. 또 다른 사람은 Muse 에이전트를 사칭해 Muse에게 말을 걸어 호스트의 root 권한을 얻었다. 그리고 404 Media에 따르면, Muse는 승인 없이 사적인 메시지를 읽고 명시적으로 하지 말라고 했는데도 클라우드에 업로드한다 — Apple이 같은 메커니즘을 악용하는 서드파티 앱을 막으려고 macOS 프라이버시 설정을 바꿔야 할 정도로 심각했다.

Wired는 Muse가 친구, 가족, 동료, 그리고 당신이 팔로우하는 사람들에 대한 상세한 인물 파일(dossier)을 만든다는 걸 알아냈다. Techdirt가 이 대목을 짚은 방식은 맞다. 일부는 에이전트가 쓸모 있으려면 필요한 것이고, 바로 그게 문제다. 사용자가 범위를 제한할 방법이 없기 때문이다. Meta의 프라이버시 우선 설계 주장은 이제 자사 제품의 행태에 의해 네 개의 서로 다른 축에서 반박당한다. 그리고 이걸 찾아내는 데 보안 연구자는 필요하지 않았다.

스레드에서 가장 유용한 댓글은 보도에 짜증 난 한 사람의 것이다. 그가 보기에 모든 항목은 그저 “에이전트가 사용자와 같은 권한을 가진다”는 것뿐이고, 전부 격리된 VM 안에서 돌아가며, 탈옥이 가능한 것도 당신 자신의 VM이기 때문이다. 그 변론은 기술적으로 일관되며, 동시에 기소장이다. 당신의 메시지 이력과 Meta가 호스팅하는 광고 기계 사이에 남은 것이 샌드박스 경계와, 사용자가 명백히 평가할 수 없는 권한 대화 상자뿐이라면, 당신은 프라이버시 제품을 만든 게 아니다. 친절한 아바타를 씌운 root 셸을 만든 것이다.

Tell HN: GitHub가 한 달이 지나도 내 소프트웨어의 크랙 복사본을 삭제하지 않는다 — 491 points

491 points · 279 comments · news.ycombinator.com · HN discussion

브라우저 사진 편집기 Photopea의 개발자는, 사람들이 AI 모델에게 자신의 JavaScript에서 광고를 제거하라고 시킨 뒤 그 결과물을 GitHub에 “새 제품”으로 재배포하고 있다고 알렸다. 그런 저장소가 수십 개다. 그는 9월 4일 게시 중단 요청을 넣었다. 한 달 뒤 GitHub는 “17 U.S. Code § 1201 위반을 확인할 수 없었다”고 답했다.

그 인용이 이 이야기의 전부다. §1201은 저작권 조항이 아니라 기술적 보호조치 우회 방지 조항이다. 스레드의 한 지식재산권 변호사는 이 거부가 법리상 아마도 맞는 이유를 설명한다. 공개적으로 서빙되는 JavaScript는 “기술적 보호조치”가 아니므로, 거기서 광고를 제거하는 건 그 밖에 무엇이든 간에 우회가 아니다. 개발자는 잘못된 법리를 제출했고, 자동 필터는 그 아래 깔린 저작권 문제는 건드리지도 않은 채 올바른 근거로 그것을 거부했다.

여기엔 진짜 수수께끼가 있다 — 저작권 표시도 접근 제어도 없는 난독화된 클라이언트 측 코드는, 그 배포 방식이 함의하는 만큼의 법적 보호, 그러니까 얇디얇은 보호만을 가진다 — 그런데 스레드는 대부분의 에너지를 인간적인 부분에 쓴다. 지식재산권 변호사인 한 댓글 작성자는 두 가지 현실적 선택지를 제시한다. 두더지잡기를 서비스로 해주는 로펌을 고용하거나, 그냥 포기하거나. 또 한 명은 자기 도메인 밖에서 돌리면 짜증 나게 만드는 휴리스틱을 넣으라고 제안하는데, 이게 표준적인 실무 답변이면서 실제로는 아무것도 막지 못한다. 스레드에 있던 한 GitHub 직원은 개발자가 접수 기록을 알려주면 내부에서 살펴보겠다고 제안하며, GitHub는 모든 DMCA 통지를 공개하고 Photopea는 2022년과 2024년의 이전 통지 두 건뿐이라고 짚는다. 글이 터진 뒤 개발자 본인의 댓글: “변호사 상대하는 대신 하루 종일 코드나 쓰면서 지낼 수 있으면 정말 좋겠다.”

EmbeddingGemma 2: 공개된 경량 멀티모달 임베딩 모델 — 411 points

411 points · 45 comments · blog.google · HN discussion

Google이 EmbeddingGemma의 후속작으로 낸 이 모델은 텍스트, 이미지, 오디오, 비디오를 하나의 임베딩 공간에 매핑한다. Apache 2.0 라이선스로 740M 파라미터로 돌아가며 잘라낼 수 있다. 텍스트 전용은 270M, 비전을 더하면 170M, 오디오는 300M이 필요하다. 마트료시카 표현 학습(Matryoshka representation learning)을 쓰면 출력 벡터를 768차원에서 128차원까지 잘라낼 수 있어, 로컬 벡터 데이터베이스 기준 저장 공간을 최대 6배 아낄 수 있다. Google은 Pixel 11 Pro에서 텍스트 전용 가중치 기준 활성 RAM이 대략 191MB, 전체 멀티모달 모델이 567MB라고 주장한다.

저장 공간 이야기가 멀티모달보다 더 중요하고, Google은 그걸 묻어버린다. 임베딩 모델에는 채팅 모델에 없는 수명주기 문제가 있다. 수백만 개의 벡터를 계산해서 저장해두는데, 모델이 독점이고 벤더가 단종시키면 전부 다시 계산하는 비용을 치러야 한다. Simon Willison이 스레드에서 이 점을 지적하며, 여기서 Apache 2.0이 마케팅 문구가 아닌 이유가 바로 이것이다. 이게 대체 업그레이드가 맞느냐는 주장에는 댓글 두 명이 반박한다. 초기 테스트에서 텍스트 전용 검색이나 클러스터링에서 기존 선택지보다 낫지도, 빠르지도 않았고, 음악 오디오에서는 여전히 MuQ-MuLan이 이긴다는 것이다. Google이 내세우는 벤치마크는 MTEB Code와 MAEB — 코드와 오디오다 — 이는 범용 임베더가 가장 잘 나올 법한 곳이면서 대부분의 사용자가 있는 곳은 아닌 지점이다.

Chrome에 JPEG XL 탑재 — 405 points

405 points · 263 comments · developer.chrome.com · HN discussion

Chrome 155가 JPEG XL 디코딩을 탑재한다. Google이 Chromium 110에서 이걸 제거하고 번복 결정을 두 번이나 거부한 지 사 년 만이다. 이 포맷은 JPEG보다 30-50% 나은 압축률, 무손실 모드, HDR, 기존 JPEG의 무손실 트랜스코딩을 제공한다. 포맷이 아니라 접근 방식에 대해 Chrome이 밝힌 이유는, 디코더를 순수 Rust(jxl-rs)로 다시 구현했다는 것이다. 이미지 디코더는 렌더러에서 신뢰할 수 없는 바이너리 구조를 처리하고, C++ 디코더는 역사적으로 범위를 벗어난 읽기, 힙 오버플로, use-after-free 버그를 만들어왔다는 근거에서다. Google의 rule of two에 따르면 디코더는 샌드박스로 감싸는 것만이 아니라 구조적으로 메모리 안전해야 한다.

재도입이 헤드라인이지만, 흥미로운 디테일은 jxl-rs가 메모리 안전한 재작성본이고 Chrome이 그것이 보안뿐 아니라 성능 면에서도 정당화될 만큼 빠르다고 주장한다는 점이다. 느린 안전 디코더였다면 각주에 그쳤을 것이다. 경쟁력 있는 디코더라면, 브라우저 코덱의 C++ 시대가 저물고 있다는 진짜 논거가 된다.

Firefox는 이번 달 정식 버전에 이를 탑재할 것으로 보이며, 이로써 Safari는 유일하게 지원하던 브라우저에서 뒤처진 쪽으로 뒤집힌다 — 한 댓글 작성자에 따르면 뒤처진 데는 특정한 이유가 있다. libjxl에 점진적 로딩이 있는데도, Safari가 이 포맷을 출시하기 전부터 라이브러리에 있었음에도 Safari는 그걸 켜지 않았다. 생태계 쪽에서는 iOS 27과 macOS 27이 이제 .jxl 파일을 제대로 처리하는데, 누군가 이걸 실제로 쓰는지를 결정하는 건 바로 이 부분이다. AVIF는 공격적인 손실 압축 용도로 남는다. 스레드에 따르면 WebP의 명분은 이제 사실상 끝났다.

Decisions API, 퍼블릭 베타 시작 — 378 points

378 points · 221 comments · developers.openai.com · HN discussion

OpenAI가 텍스트, 이미지, 또는 둘 다를 평가하고 타입이 지정된 답을 돌려주는 전용 엔드포인트를 내놨다. 조건이 성립할 확률(predicate), 주어진 집합에서의 선택, 또는 순서가 있는 등급에 대한 점수다. Responses API보다 대략 10배 빠르다고 주장한다. gpt-6-luna만 지원한다. 퍼블릭 베타이고, 정식 출시(GA)는 “몇 주 안에.”

흥미로운 점이 두 가지다. 첫째, 타이밍. OpenAI는 이 워크로드를 잡아먹어온 작은 오픈 의사결정 모델 Jev에 대응하고 있으며, 프런티어 채팅 모델이 한 번도 노출하지 않았던 신뢰도 점수를 API에 붙이고 있다. 둘째, 한 댓글 작성자가 API를 교과서적인 확률 실험에 돌려봤는데, predicate 질문은 편향된 동전과 구슬 단지에서 거의 정확한 확률을 내놓는 반면, choice 질문은 무작위 추출처럼 전혀 작동하지 않았다 — 빨간 구슬을 뽑을 참 확률 50%가 86%로 돌아왔다. 이는 문서가 “순서 없는 범주”에 권장하는 바로 그 질문 유형에서의 보정(calibration) 실패이며, 어느 벤더의 벤치마크 표도 드러내지 않을 실패다.

스레드에서 되풀이되는 또 다른 주제는 가격 경쟁이 고객을 붙잡아두려고 출력 토큰까지 포기하는 지경에 이르렀다는 것이다. 20억 파라미터짜리 로컬 모델이 분류 질문에 115ms 만에 공짜로 답할 수 있다면, 그걸 프런티어 API로 돌리는 가치는 반올림 오차에 불과하다. 실제로 와닿는 불만은 확률 수치 자체가 이상하리만치 빈약하다는 점이다. 한 댓글 작성자는 모델의 신뢰도를 노출하는 것이 신뢰를 쌓기는커녕 파괴할 수도 있다고 지적한다. 현재 보정된 수치가 기업이 의사결정에 쓰고 싶어 할 어떤 것과도 대응하지 않기 때문이다.

Claude Haiku 5.5 — 360 points

360 points · 170 comments · anthropic.com · HN discussion

Anthropic의 새 소형 모델은 평균적으로 Haiku 4.5보다 실행 비용이 대략 75% 저렴하고, Haiku 등급에서는 처음으로 조절 가능한 노력(effort) 설정을 제공하며, Opus 5.5 및 Sonnet 5.5와 서브에이전트로 짝을 이룬다. 회사는 Sonnet 5.5의 캐시 읽기 가격을 절반으로 줄이고 Max 및 Team 구독자에게 월간 API 크레딧을 추가한다 — Max 5x는 월 $100, 20x는 $200, Team은 최대 $500까지 풀링한다.

자체 보고 벤치마크는 극적이며 그렇게 읽어야 한다. GDPval-AA v2.1은 1620 대 Haiku 4.5의 735, OSWorld 2.1 컴퓨터 사용은 72.4% 대 15.7%, Terminal-Bench 4.0은 39.2% 대 0.0%. 벤더가 고른 벤치마크에 벤더가 낸 숫자다. 진짜 전환은 가격에 있고, 그 폭은 헤드라인보다 좁다. Haiku 5.5는 이제 100,000 토큰까지는 GPT-6 Luna와 같은 가격이고, 그 다음부터는 Luna가 더 싸다. 이 때문에 Haiku의 실질적 상한은 겉에 붙은 값보다 낮아진다. 에이전트는 100k 토큰쯤은 일상적으로 태워버리고, 할인은 정확히 워크로드가 비싸질 때 사라지기 때문이다.

독립적인 결과가 표보다 더 유용하다. Simon Willison의 SVG 펠리컨 테스트에서 저노력 설정은 0.09센트에 7초, 최대 설정은 3.38센트에 5분 9초가 걸렸고, 망가진 자전거 프레임을 그려낸 건 저설정뿐이었다. 다른 댓글 작성자의 이미지-HTML 변환 테스트는 Haiku가 복잡한 UI에는 충분하지 않다는 결론을 내렸고 — 게다가 모델 스스로 그걸 알아차리고 작업을 Opus 5.5에 위임했다고 한다 — 이는 표의 어느 벤치마크도 담지 못하는 행동적 디테일이다.

Visa, Mastercard와 주요 은행들, ‘반경쟁적’ 수수료 관련 새 소송에 직면 — 354 points

354 points · 208 comments · classaction.org · HN discussion

샌디에이고의 한 피자집이 9월 30일 Visa, Mastercard, Bank of America, Capital One, Chase, Citibank, Wells Fargo를 상대로 134쪽짜리 집단소송을 제기하며, 피고들이 획일적인 교환 수수료(interchange fee) 체계를 정하고 이들을 견제할 수 있는 시장의 힘을 무력화하는 “반경쟁적 규칙의 그물망”을 유지해왔다고 주장했다. 소장의 핵심 주장은 개별 거래가 아니라 구조에 관한 것이다. 모든 카드를 받아야 하는 규칙(honour-all-cards)은 가맹점이 비용과 무관하게 모든 Visa, Mastercard 제품을 받아들이도록 강제해, 발급 은행이 수수료로 경쟁할 유인을 없앤다. 반면 소비자 유도 금지 규칙(anti-steering)은 가맹점이 카드 결제에 할증을 붙이거나 고객을 더 저렴한 결제 수단으로 유도하는 것을 막는다. 소장에 따르면 가맹점은 카드 수납 수수료로 연 1,000억 달러 이상을 내며, 피고들은 해마다 “아무 문제 없이” 수수료를 올려왔다.

이게 기존 소송의 연장이 아니라 새 소송인 이유는 이해해볼 가치가 있다. 2019년 12월 승인된 합의는 50억 달러 이상을 제공했지만, 2019년 1월 24일에 끝나는 클래스 기간에 한정됐다. 별도의 “형평적 구제(equitable relief)” 협상은 장래의 규칙 변경을 낳았고, 소장에 따르면 그 이후 낸 수수료에 대한 보상은 단 한 푼도 없다. 즉, 문제의 반경쟁적 행위는 20년간 소송이 벌어졌고, 과거에 대해 한 번 합의됐으며, 이제 현재에 대해 다시 소송이 벌어지고 있다. The Pizza Standard LLC는 대략 같은 시장에서 같은 피고들을 상대로 한 원고 측의 네 번째 시도다.

스레드는 소송이 닿지 못하는 곳으로 간다. 댓글 작성자 두 명은 명백한 해법이 법원에 아무것도 요구하지 않는다고 지적한다. 가맹점이 카드 거래에 투명하게 할증을 붙이도록 허용하고, 개별 카드 제품을 불이익 없이 받거나 거부하도록 허용하라는 것이다. 둘 중 어느 것이든, 의도적으로 가격 경쟁을 설계로 걷어낸 시장에 가격 경쟁을 끌어들일 것이다. 더 넓은 논거 — 결제, 물류, 중립적 시장은 인프라이며 공공이어야 한다 — 는 이 소송이 건드리지 않을 것이다.

클래식 Commodore 64 키캡 사진으로 재현한 폰트 — 348 points

348 points · 59 comments · github.com · HN discussion

누군가 자기 중앙유럽판 Commodore 64의 키캡을 촬영해, 모든 글자, 숫자, 기호, PETSCII 그래픽 범례를 그대로 따서, 비율이 일관된 폰트로 정규화했다. 버전 1.112에 GPL 계열이고, TTF, OTF, 웹폰트로 배포되며 온라인 미리보기도 있다. 소문자를 입력해도 대문자로 렌더링되는데, 원래 키캡에 소문자가 없었기 때문이다. PETSCII 전면 범례는 매끈한 기하학적 도형으로 재구성됐고, 저장소는 이게 화면의 비트맵 폰트가 아니라 인쇄된 범례를 재현한 것이라고 명시한다 — 실제로 써본 사람이라면 중요한 구분이다.

사소해 보이지만 실은 그렇지 않은 부류의 프로젝트다. 어려운 부분은 키캡 사진마다 조명, 원근, 마모가 다르다는 것이고, 따라서 세트가 하나의 일관된 서체로 읽히려면 글리프를 하나하나 개별적으로 정규화해야 한다. 댓글은 고고학을 보탠다 — VIC-20은 Microgramma를 썼고, 맨해튼에서 가장 열심히 일하는 폰트 Gorton에 관한 긴 에세이 링크도 있다.

AnyPS5: 에뮬레이션 없이 PS5 바이너리를 PC로 포팅 — 336 points

336 points · 291 comments · github.com · HN discussion

AnyPS5는 PS5 실행 파일을 다시 링크하고, 그것들이 링크하려는 시스템 라이브러리의 구현을 제공함으로써 네이티브 Linux 및 Windows 바이너리로 변환한다. 에뮬레이션도, 별도의 런타임 프로세스도 없다. 셰이더를 SPIR-V로 재컴파일하고, SDL 게임 컨트롤러를 매핑하며, README는 시스템 라이브러리의 87%를 매핑했다고 광고한다. 검증된 게임 하나인 Dreaming Sarah는 GTX 1050 Ti에서 안정적인 60fps로 돌아간다. 스타 9.8k.

87%라는 수치는 코드를 들여다보는 순간 버티지 못한다. README 각주는 이게 “지금까지 프로젝트가 아는 함수”의 비율이며 모든 PS5 시스템 함수의 비율은 아니라고 인정한다 — 분모를 프로젝트가 고른 비율이므로, 함수를 더 파악할수록 내려갈 수밖에 없다. 소스를 본 한 댓글 작성자는 더 직설적이다. 프로젝트가 “매핑됐다”고 부르는 건 OK를 반환하는 함수가 잔뜩 있는 것뿐이라고. 이건 사기에 대한 고발이 아니라, 초기 단계 재링커의 모습 그대로다. 그리고 README는 HN 제목보다 이 점에 더 정직하다.

이 이야기가 336점으로 프런트 페이지에 오른 이유는 현재의 호환성 목록이 아니다. 궤적이다. 예전에는 전문가 팀이 몇 년 걸리던 리버스 엔지니어링 작업이 이제는 발매 몇 달 안에 대작을 플레이할 수 있으리라는 추측이 나올 만큼 빨라졌다 — 그리고 그것은 다시 말해 콘솔 제조사들의 클라우드 게이밍 밀기에 대한 지금까지 가장 강력한 논거다. 에뮬레이터를 내리는 것보다 자기 기기에 있는 네이티브 바이너리를 회수하는 게 훨씬 어렵기 때문이다.

질량 기준으로 지구의 지배적 종은 무엇인가? — 290 points

290 points · 219 comments · signoregalilei.com · HN discussion

바이오매스 수치를 꼼꼼히 훑는 글이고, 답은 그렇게까지 벌어지지 않는다. 인간은 약 3억 5,000만 톤, 남극 크릴은 3억 7,900만 톤, 질량 기준 단일 최대 동물 종인 소는 약 6억 5,000만 톤이다. 그런데 단위가 바뀌면 동물에서는 이 질문이 더 이상 흥미롭지 않다. 탄소 기준으로 모든 동물을 합쳐도 20억 톤으로, 원생생물(40억), 고세균(70억), 균류(120억), 세균(700억), 식물(4,500억)보다 적다. 식물 중 승자는 곡물이 아니라 흑가문비나무로 바이오매스가 약 110억 톤이다. 사탕수수는 연간 수확량 기준 최대 작물로 20억 톤이 넘는데, 인류 전체 무게의 약 여섯 배이며 다년생이라 상시 질량은 단일 수확이 시사하는 것보다 높다.

댓글 중 최고의 문장은, 우리를 포함한 모든 동물이 전체 바이오매스의 약 0.4%이고 인간, 가축, 조류, 야생 포유류를 다 합쳐도 약 0.02%라는 것이다. 이 장르 전체에 맞는 프레임이다. “지배적 종”은 또 다른 반올림 오차 속의 반올림 오차에 관한 질문이고, 바이오매스 순위는 대체로 어느 계(kingdom)가 육상 표면을 먼저 차지했는지의 지도일 뿐이다.

Strands Decider 2B: 작고 오픈소스인 의사결정 모델 — 274 points

274 points · 77 comments · strandsagents.com · HN discussion

텍스트를 생성하는 대신 예/아니오 질문에 답하는 2B 파라미터 모델이다. 구조적으로는 Qwen3.5-2B 몸통에서 언어모델 헤드를 떼어낸 것으로 — 텍스트 생성은 전혀 없다 — 그 자리에 <answer> 마커의 은닉 상태에 대해 주어진 각 선택지를 점수화하는 포인터 헤드를 붙였다. 헤드는 약 100만 파라미터이고, 몸통은 rank-16 LoRA로 파인튜닝했다. 중위 지연시간은 RTX 3090에서 ~115ms, M3 MacBook에서 ~153ms다. 가중치, 학습 데이터, 스크립트가 모두 GitHub과 Hugging Face에 있다. 팀은 JevBench 정확도에서 2B 등급 33개 중 3위, 2B를 살짝 넘는 모델들을 제외하면 30개 중 1위라고 주장한다.

이런 기능을 뺀 것은 의도적이며 논거도 옳다. 모든 출력을 한 번의 병렬 패스로 생성하면 이 모델들은 복잡한 문제에서 추론 모델보다 못해지고, 텍스트 출력이 없으면 채팅이나 요약에는 쓸모가 없다. 대신 주는 것은 프런티어 LLM API가 노출하지 않는 보정된 신뢰도 점수와, 같은 프롬프트에 여러 질문을 저렴하게 던질 수 있는 능력이다. 글에 실린 데모가 흥미로운 부분이다 — 디사이더(decider)가 제안된 툴 호출을 읽고 두 가지 질문에 답하며(인자가 사용자가 말한 무엇에도 근거하는가, 호출하기엔 성급한가), 에이전트는 아무도 언급하지 않은 어딘가의 날씨를 자신 있게 보고하는 대신 도시를 되묻는다.

충돌이 눈에 띈다. 이것과 OpenAI의 Decisions API가 같은 주에 같은 논지로 나왔다. 에이전트 인프라의 다음 층은 더 큰 채팅 모델이 아니라 값싼 보정 분류기라는 것이다. 스레드의 주요 불만은 용어다 — 이진 결정을 가리키는 “noul”이라는 말은 Jev에서 빌려온 것이다 — 그리고 한 댓글 작성자가 제안한 대안, Jerry라는 이름의 인간이 뒷받침하는 의사결정 모델이 스레드에서 가장 정직한 제품 피치다.

2026년 노벨 화학상, Henri B. Kagan과 Kenso Soai에게 — 262 points

262 points · 47 comments · nobelprize.org · HN discussion

비대칭 유기 합성에서의 비선형 효과와 자기촉매 반응에 수여됐다 — 화학이 두 가지 손잡이(handedness)를 똑같이 만들어내는데도 생명이 어떻게 아미노산 한쪽 손잡이만 갖게 됐는지 그 뒤의 화학이다. Kagan의 1986년 발견은 한쪽 거울상 쪽으로 반응을 밀어붙이는 게 누구도 가능하다고 생각하지 못했던 수준까지 갈 수 있음을 보여줬다. Soai는 1995년 단일 거울상만 만들 잠재력을 지닌 최초의 반응을 설계했고, 2003년 실제로 한쪽 거울상만 생성하도록 만드는 데 성공했다. 위원회에 따르면, 생명 자체를 제외하면 이전에 이를 해낸 것은 없었다.

실질적인 쟁점은 철학적이지 않다. 제약 개발에서 분자의 거울상 중 한쪽만 원하는 작용을 하므로, 반응을 한쪽 손잡이로 확실하게 몰아가는 방법은 성공하는 합성과 분리해야 할 라세미체(racemate) 사이의 차이다. 스레드 최고의 댓글은 화학에 관한 것도 아니다. 배아 섬모 안의 단백질 모터의 키랄성이 물의 좌향 흐름을 만들어내고, 이것이 발달하는 몸의 좌우 비대칭이 확립되는 방식이다. 생명은 한 손잡이 분자로만 지어진 게 아니라, 그 손잡이를 이용해 심장이 몸의 어느 쪽에 갈지 정한다.

Paramount Skydance, Warner Bros. Discovery와의 $111B 합병을 완료하다 — 262 points

262 points · 472 comments · arstechnica.com · HN discussion

대법관 Elena Kagan이 막판 차단 시도를 기각한 뒤 거래가 종결됐다. 합병 회사는 Skydance라 불리며 두 개의 대형 스튜디오, Paramount+와 HBO Max, CBS, CNN, 그리고 CBS Sports와 TNT Sports를 포함한 라이브 스포츠를 거느린다. 캘리포니아 북부지법의 Araceli Martínez-Olguín 판사는 7월 판결에서 이 결합이 경쟁을 실질적으로 감소시키고 반독점법을 위반할 가능성이 크다고 인정했다. 캘리포니아는 지난달 합의했고 나머지 원고 주 11개도 따라갔다. 시민단체들은 판사에게 타협안을 거부하라고 촉구했지만 뜻을 이루지 못했다.

이 글에는 472개의 댓글이 달렸고, 기억해둘 만한 댓글은 결과가 아니라 패턴을 짚는 것이다. 스레드에서 인용된 Verge의 상투적 표현: 미국에 유일하게 통했을 반독점 정책은 누구든 다시는 Time Warner를 사지 못하게 금지하는 것이었을 것이다. 2001년: AOL이 Time Warner를 산다. 2018년: AT&T가 Time Warner를 산다. 2022년: WarnerMedia가 AT&T에서 분사해 Discovery와 합병한다. 2026년: Paramount가 그것을 산다. 25년 동안 네 번의 구조조정, 매번 직전의 실패가 명분이었다.

스레드의 또 다른 실질적 지적은 부채다. 새 법인은 무거운 짐을 지고 출발하며, 경쟁 구도에 견줘 수치가 결코 좋지 않다. YouTube가 미국 시청 시간의 약 13%를 쥐고 있는 반면, Paramount와 Warner 자산을 합쳐도 약 6%다. 지상파 텔레비전에서 규모를 사는 건 다음 10년을 위한 전략이라고 보기 어렵고, 쇠퇴하는 사업을 부채로 융자하는 통합은 투자가 아니라 구조조정으로 귀결되는 경향이 있다.

Claude Code의 제안 메시지 기능: 진짜 고객은 모델이라고 생각한다 — 260 points

260 points · 150 comments · zohaib.cc · HN discussion

Claude Code는 작업을 끝낸 뒤 다음에 보낼 메시지를 제안하며 프롬프트 상자를 미리 채우기 시작했다 — “run the tests”, “commit this”. 글쓴이의 주장은 이게 사용자 기능이 전혀 아니라는 것이다. 사용자가 자기가 주석을 달고 있다는 걸 모른 채 공짜로 돌리는 RLHF 주석 파이프라인이라는 것이다. 제안을 그대로 보내면 긍정 레이블이 되고, 고쳐 쓰면 선호 쌍(preference pair)이 만들어지며, 예측과 수정 사이의 차이는 예측이 정확히 어디서 실패했는지 보여준다. 코드베이스를 아는 사람이, 맞는 게 중요해지는 바로 그 순간에 쓴 것이다.

논증은 잘 세워졌고, 스레드의 반박은 더 낫다. 한 댓글 작성자는 사용자 턴 마커로 끝나는 프롬프트를 LLM에 넣기만 해도 그럴듯한 다음 턴 예측이 나온다고 지적한다. 손실 함수가 대화의 양쪽을 구분하지 않기 때문이다. 그래서 Anthropic은 아마 이 동작을 공짜로 얻었고 최근에야 노출하기로 했을 것이며, 이는 관찰 자체를 무너뜨리지 않으면서 “학습 데이터 파이프라인” 주장을 약화시킨다. 더 날카로운 반론은 사용자에게 예측을 보여주면 사용자의 응답이 그쪽으로 편향돼, 만들어지는 레이블이 프롬프트 없이 수정한 것보다 독립성이 떨어진다는 것이다. 글쓴이 자신의 프레이밍은 둘 다 견딘다. 이게 주된 목적인지는 그리 중요하지 않고, 레이블 흐름이 부작용이라도 여전히 레이블 흐름이며, 아무도 동의를 구하지 않는다.

실제 사용자 경험을 가장 잘 담은 댓글은, 자기가 요청하지 않은 기능을 Claude가 바꿔놓았고, 제안된 다음 메시지가 대략 “그 변경을 되돌려”였던 사람의 것이다. 모델은 알고 있었다. 그래도 했다.

모두를 위한 GPT‑6와 Intelligent UI — 256 points

256 points · 123 comments · openai.com · HN discussion

GPT-6가 ChatGPT 무료 등급에 풀리고, 그와 함께 “Intelligent UI”가 온다 — 문단 대신 텍스트, 그래픽, 누를 수 있는 버튼, 폼, 차트, 인터랙티브 다이어그램을 조합한 응답이다. 글에 나온 자전거 예시는 프레임과 구동계에 관한 텍스트 벽을 대체하는, 선택 가능한 하위 시스템이 달린 라벨 붙은 다이어그램을 보여준다.

두 가지 반응이 지배적이다. 첫째는 OpenAI의 릴리스 페이지가 웹에서 가장 잘 디자인된 제품 마케팅이라는 것인데, 이 칭찬은 조용히 이 발표가 마케팅임을 인정하는 셈이다. 둘째는 미학적 혐오다 — 한 댓글 작성자는 생성된 페이지를 쓸데없는 여백과 체크리스트 투성이라 마치 깔보는 것 같다고 묘사하며, 이 형식이 개발자 도구로 새어들면 어떻게 될지 걱정한다. 더 흥미로운 질문은 스레드 더 아래에 묻혀 있는데, 지연시간이다. 모든 질문에 맞춤형 UI를 생성하는 비용이 문제될 만큼 큰가. 스레드의 누구도 그 수치를 갖고 있지 않다.

반론의 정직한 버전은 Bartosz Ciechanowski의 손수 만든 인터랙티브 해설이 자동화될 거라고 아무도 예상하지 못했던 마지막 대상이었고, 그것들은 여전히 생성된 무엇보다 낫다는 지적에서 나온다. 둘 다 사실이다. 생성된 쪽은 어떤 주제든 지금 당장 쓸 수 있고, 더 나쁘다.

State of Devs 2026 — 233 points

233 points · 158 comments · 2026.stateofdevs.com · HN discussion

응답자 5,463명, 조사 기간은 7월 5일부터 9월 5일까지. 거의 절반이 고용 불안과 부족한 임금을 겪었고, 4분의 1은 경력 중 언젠가 해고를 당했으며 거의 10명 중 1명은 지난 9개월 안에 그랬다. 4분의 1이 넘는 사람이 통제할 수 없는 이유로 5년 안에 직업을 바꿀 것으로 예상한다. 3분의 2가 최근 의욕 저하나 냉소 증가를 보고했고, 절반 정도가 집중 어려움, 늘어난 미루기, 소진감을 보고했다. 62%가 언젠가 번아웃을 겪었다고 보고했다 — 작년과 동일하다.

여기서 뭔가를 읽어내기 전에 두 가지 단서를 달아야 한다. 개발자 설문에 답하는 5,463명을 스스로 선택한 표본은 모집단이 아니며, 작년 번아웃 수치와의 비교는 안정성으로 보고된 영가설(무의미한 결과)이다. 이 설문이 실제로 확립하는 것은 설문을 채울 만큼 의욕이 있는 사람들이 겁먹었다는 것이고, 이를 생생하게 보여주는 댓글은 7월에 5년 커리어 질문에 “그럴 것 같지 않다”라고 답했지만 지금은 “그럴 것 같다”라고 답할 거라는 사람의 것이다 — 석 달 안의 변화다.

가장 날카로운 댓글은 데이터와 무관하다. 63%로 나온 “나쁜 관리” 범주는 정의가 없으면 무의미하다. 개발자들은 “내가 하라는 것에 동의하지 않는다”를 습관적으로 나쁜 관리로 분류하는데, 실제로 일어난 일은 아무도 그 근거를 설명해주지 않은 것뿐일 때가 많다. 이는 진짜 측정 문제이고, 이 페이지 차트 대부분에 해당한다.

Penguin Mail — AI를 곁들인 Linux용 오픈소스 Rust 이메일 클라이언트 — 229 points

229 points · 169 comments · penguin-mail.com · HN discussion

GPL-3 라이선스의 Linux 메일/캘린더 클라이언트, 버전 1.0.0. Gmail, Microsoft, 일반 IMAP/POP3, CalDAV, CardDAV를 지원한다. 자체 GnuPG를 통한 OpenPGP와 S/MIME, 키 보관은 하지 않는다. Gmail 필터, Microsoft 받은편지함 규칙, Sieve 규칙을 편집 가능한 평이한 언어 규칙으로 노출한다. 선택적 어시스턴트는 LM Studio나 Ollama로 로컬에서 돌아가고, 모델을 고르기 전에는 꺼져 있으며, 메일을 보내거나 설정을 바꾸기 전에 물어본다. 자체 서버도, 추적도, 광고도 없다. Gmail은 Google과, Microsoft 계정은 Microsoft Graph와 통신한다.

마지막 제약 조건 묶음은 메일 클라이언트의 올바른 아키텍처이고, 거의 아무도 그렇게 만들지 않는다. 그래서 버전 1.0.0으로 주 사용 받은편지함에 겨누기엔 위험한 물건인데도 229점으로 프런트 페이지에 올랐다. 스레드의 첫 질문 역시 맞는 질문이다. HTML 메일 본문을 얼마나 잘 정화(sanitise)하는가? Thunderbird는 인라인 JavaScript와 추적 픽셀을 막으려고 상당한 공을 들인다. 메일을 그냥 WebView에 렌더링하는 클라이언트라면 사용자들이 무시하기로 배운 위협 표면에서 퇴보다. 두 번째 불만은 더 작지만 시사적이다 — Fastmail이 지원 제공자로 이름을 올렸는데 JMAP은 지원하지 않는다.

Git 작업, 풀 리퀘스트, Actions 장애 – 해결됨 — 222 points

222 points · 175 comments · githubstatus.com · HN discussion

GitHub은 15:06부터 15:16 UTC 사이에 Git 작업, 풀 리퀘스트, Actions, Issues, Webhooks 전반에 걸쳐 광범위한 영향을 보고했고, 그다음 대략 20분 동안 “성능 저하 경험 중”, “완화됨, 안정성 모니터링 중” 공지로 상태 페이지를 갱신한 끝에 복구를 선언했다. 근본 원인은 “확인됨”, 상세 분석은 약속됐다. 사용자가 체감한 총 장애는 약 한 시간이다.

이게 222점으로 뉴스 가치가 있는 이유는 장애도, 지속 시간도 아니다. 상태 페이지가 “해결됨”이라고 한 뒤에도 댓글 작성자들이 여전히 Internal Server Error를 받고 있었다는 점이다. 한 사람은 이를 “꽤 형편없는 사용자 경험”이라고 불렀다. 성급한 이상 없음 선언이었다. 또 한 명은 실패한 빌드를 5분 동안 디버깅하다가, 상태 페이지를 확인하는 게 더 빠른 진단이라는 걸 뒤늦게 떠올렸다. 세 번째 사람은 89.99%가 쓰리 나인(three nines)으로 쳐지느냐고 물었다 — 업계의 모든 CI 파이프라인과 의존성이 이제 단일 장애점 뒤에 있는 플랫폼에 맞는 질문이다.

아직 페이지에 남아 있는 것들

오늘 200점을 넘긴 서른한 개 이야기 중 열두 개는 이전 라운드업에서 다뤘다. 델타는 각 이야기를 추적한 마지막 라운드업 기준이며, 전부 어제자다.

목록 맨 위는 가장 많이 움직였고 가장 중요하지 않은 항목이다. Mistral Large 4는 1,261 → 1,980, +719로, 1,184개 댓글과 함께 1위를 지키고 있다 — 가중치가 이달 말에나 나오는 모델의 퍼블릭 프리뷰이고, 같은 이야기의 두 번째 제출(“Mistral Large 4: Le Chonk”)이 521 points로 자체 보도 없이 올라 있다. Anthropic reported diary entry to police는 어제의 480점 급등에 이어 795 → 822, +27로 계속 오르고 있으며, 667개 댓글로 이 구간에서 압도적으로 가장 많이 논의된 항목이다. Web Search API는 581 → 588, +7이다.

어제의 온전한 섹션 두 개가 크게 성장했다. OpenTPU는 159 → 332, +173 — 어제는 159 points로 “AI가 이제 자체 추론 하드웨어를 개발할 수 있다”였고, 사람들이 SystemVerilog를 하루 읽은 뒤 거의 두 배가 됐다. **Nature’s capacity to ‘bounce back’**는 264 → 342, +78, Polars 2.0은 355 → 454, +99. 노벨 물리학상 발표는 수상 업적 프로필이 퍼지면서 444 → 568, +124 움직였다. 더 작은 움직임: Gleam 252 → 313, +61; Example.com 318 → 356, +38; JetBrains’ 2025 results 553 → 590, +37; Beam 526 → 549, +23; Opus 5.5 agents and the magnetic semiconductors 475 → 488, +13.

이 목록의 형태는 어제와 같고, 하루 더 진행됐을 뿐이다. 프런트 페이지는 스무 개 남짓을 보여주는데 순위 목록에는 200 points를 넘긴 게 서른한 개이고, 둘의 차이는 스토리가 페이지를 떠난 뒤 쌓이는 누적분이다. 그 격차는 이제 하루치 자료의 약 3분의 2다.

관통하는 흐름

첫째: 업계가 이번 주 같은 제품을 두 벌 내놨고, 어느 것도 채팅 모델이 아니다. OpenAI의 Decisions API와 AWS의 Strands Decider 2B가 며칠 차이로 같은 논지로 나왔다 — 에이전트 인프라의 다음 층은 작고 빠르며 보정된 예/아니오 분류기이고, 신뢰도 점수가 답보다 중요하다는 것이다. 하나는 허용된 단일 모델 위의 독점 엔드포인트이고, 다른 하나는 Hugging Face에 있는 740M 파라미터의 가중치, 학습 데이터, 스크립트다. 둘이 일치하는 지점이 불일치하는 지점보다 더 많은 걸 드러낸다. 프런티어 연구소들은 이제 가장 똑똑한 모델이 당신 질문에 답하게 만드는 경쟁을 하는 게 아니라, 가장 싼 모델이 질문하기를 그만두게 만드는 경쟁을 하고 있다. Decisions API 스레드의 독립적 보정 테스트 — choice 질문에서 참 확률 50%가 86%로 돌아온 것 — 는 벤더 바깥의 누군가가 귀찮음을 감수하고 확인했기 때문에만 존재하는 종류의 발견이다. 피치가 “우리 신뢰도 점수를 믿으라”일 때 이는 반복적으로 문제가 될 것이다.

둘째: 검증이 희소재이고, 오늘의 페이지는 그것이 어떤 모습인지, 없는 모습이 어떤지 보여준다. OpenAI의 수학 발표는 몇 주 만에 검증 가능한 결과물을 함께 낸 유일한 발표다. Lean 형식화, 공개된 실패, ChatGPT Pro 시간 단위의 컴퓨트 추정치, 이름이 있는 자문 그룹. 그게 기준선이고, 나머지 전부가 이 기준을 통과하지 못할 만큼 낮게 설정돼 있다. Haiku 5.5의 벤치마크 표는 벤더 벤치마크에 벤더가 낸 숫자이고, 뒤따른 독립 테스트는 표보다 덜 후하다 — 모델은 빠르고 저렴하지만 복잡한 UI에는 충분하지 않으며, 이 판단을 위임하기 전에 스스로 내린 듯하다. EmbeddingGemma 2의 간판 멀티모달 주장은 초기 테스트에서 텍스트 전용 검색에서는 재현되지 않는다. AnyPS5의 87%는 분모를 프로젝트가 정의하는 비율이고, 코드를 읽은 댓글 작성자는 “매핑됐다”는 함수들이 대부분 OK를 반환하는 스텁이라고 말한다. 릴리스 노트와 결과물 사이의 간극은 이제 출시의 표준 형태가 됐고, 그걸 메우는 확실한 방법은 각주를 읽거나, 소스를 보거나, 자기만의 벤치마크를 가진 누군가를 기다리는 것뿐이다.

셋째: 통제보다 역량이 먼저 출하됐고, 공개는 각주에 있다. Meta의 Muse가 가장 명확한 사례다 — 제로데이, 사칭을 통한 root 접근, 명시적 지시에 반하는 비공개 메시지 업로드, Apple이 통제하려고 macOS 설정을 바꿔야 할 만큼 망가진 Mac 프라이버시 모델, 이 모두가 프라이버시 우선 깃발 아래에서 일어났다. Claude Code의 제안 상자는 같은 문제의 부드러운 버전이다. 사용자가 어차피 하는 작업을 이용해 모델을 개선하는 레이블링 파이프라인이고, 아무도 동의를 구하지 않으므로 동의가 필요 없다. Decisions API는 감사할 수 없는 확률로 당신의 요청을 라우팅하려 한다. GPT-6의 Intelligent UI는 훑어볼 수 있는 산문을 한눈에 파악할 수 없는 생성된 인터페이스로 대체한다. 이 중 어느 것도 종류가 새로운 건 아니고, 전부 규모가 새롭다. 달라진 것은 권한 대화 상자가 이제 당신의 메시지, 돈, 캘린더를 쥔 시스템의 보안 경계가 됐다는 점이고, 사용자가 그 대화 상자를 평가할 수 있다는 증거는 Marketplace 계정을 넘겨주고 집 주소를 잃은 한 유튜버다.