오늘 프론트페이지에는 서른 개의 이야기가 있다. 그중 열네 개가 200포인트를 넘는다. 전체 500개 순위 목록에는 124개가 있는데, 52개는 160위 안에, 72개는 161위에서 491위 사이의 긴 꼬리에 앉아 있어 프론트페이지가 결코 보여주지 않을 자리다. 그 124개 중 서른여섯 개는 지난 다섯 번의 라운드업에서 다룬 적이 없다.

오늘 페이지의 모양은 설명하기 쉽다. 프런티어 규모 오픈 웨이트 모델 발표 두 건, 그리고 둘 다 가중치가 없다. Mistral은 조 단위 파라미터 모델이 공개 프리뷰 중이고 가중치는 이달 말에 나온다고 말한다. Reflection은 5,010억 파라미터 모델이 최종 레드팀 검증 중이고 가중치는 이달 안에 나온다고 말한다. 둘을 합쳐 1,787포인트이며, 두 결과물 모두 연구소 밖에는 존재하지 않는다. Aleph Alpha는 이미 내려받을 수 있는 780억 파라미터 모델로 141위에서 699포인트를 쥐고 있는데, 프론트페이지는 그걸 보여주지 않는다.

그리고 이 창에서 단일 최대 상승폭은 눈에 보이지 않는다. 앤트로픽이 일기장 기록을 경찰에 신고는 480포인트를 얻어—315에서 795로, 댓글 630개—36위에 있다. 프론트페이지는 오늘 대신 플레이스홀더 도메인의 CSS 애니메이션을 전했다. 그것은 투표자들에 대한 불평이 아니다. 순위를 관련성으로 취급할 때 나오는 결과다.

Mistral Large 4 — 1,261 points

1,261 points · 811 comments · mistral.ai · HN discussion

Mistral은 Mistral Large 4—공식 명칭 ‘le Chonk’—의 공개 프리뷰를 열었다. 조 단위 파라미터에 활성 파라미터 490억 개인 네이티브 멀티모달 모델이다. 가중치는 이달 말에 풀린다. Mistral 자체 유럽 데이터센터의 Nvidia Grace Blackwell GPU 3,800개로 처음부터 학습됐고 같은 하드웨어에서 서빙된다. 학습 데이터의 상당 부분이 다국어였고, EU의 모든 공용어를 포함해 160개 이상의 언어에 걸쳐 있다.

마케팅은 주권으로 포장됐고, 이번만큼은 그 포장이 하중을 지탱한다. Mistral의 논지는 제공자 수준의 거부가 정당한 취약점 연구와 사고 대응을 막으며, 사고 도중 능력 접근을 잃는 것 자체가 보안 위험이라는 것이다. 그래서 제안은 오픈 웨이트와 자체 배포가 가능한 사이버 특화 모델이다. 그 목적으로 출시 전에 완화된 조정과 확장된 사이버 능력을 가진 채 사이버보안 기업, ‘검증된 파트너’, 국가 당국에 의해 레드팀 검증을 받고 있다. 두 번 읽어라. 외부 주체가 잠금 해제되고 사이버에 특화된 조 단위 파라미터 모델을, 대중이 잠긴 모델을 받기 몇 주 전에 받는다. 가장 방어 가능한 버전의 논리이며, 동시에 오늘 페이지에서 가장 흥미로운 위험이다.

이 스레드는 HN이 하는 모든 것의 댓글 811개다. Simon Willison은 추론 제어가 ’none’과 ‘high’ 두 설정뿐이며, high가 none보다 출력 토큰을 더 적게 냈다고 지적한다—여기에 요즘 이 스레드들의 사실상 표준 비전 벤치마크인 펠리컨 테스트도 붙는다. 한 댓글러는 펠리컨이 완벽하다고 답하며 AGI가 도래했다고 선언한다. 좋은 논쟁은 능력이 아니라 자본에 관한 것이다. 한 댓글러는 Mistral의 최대 위협은 유럽에, 주권 성장 투자자들이 필요로 하는 밸류에이션 단계 상승을 흡수할 만큼 깊은 자본시장이 없다는 것이며, 그게 ’내일의 문제’로 남는 건 회사가 상장하지 않는 동안뿐이라고 말한다. EU에 기반을 둔 한 댓글러는 더 유용한 자백을 한다. 코딩에는 미국 공급자를 쓰겠지만, 자기 제품 내부의 기능에는 절대 쓰지 않겠다는 것. 주권 수요가 실제로 작동하는 모습이 그렇고, 발표가 시사하는 것보다 작은 숫자다.

Beam: Reflection의 501B 오픈 웨이트 모델 — 526 points

526 points · 164 comments · reflection.ai · HN discussion

Reflection의 Beam은 희소 전문가 혼합(mixture-of-experts) 모델로, 총 파라미터 5,010억 개에 활성 230억 개이며, 웹과 ’독점 라이선스 데이터셋’에서 가져온 23조 8,000억 토큰으로 사전학습됐다. 보도자료에서 뽑아낼 가치가 있는 숫자는 RL 실행이다. 4주에 걸쳐 Nvidia GB300 GPU 10,500개에서 1억 회 이상의 롤아웃. 그것이 실제 해자의 공개다. 표에 들어가는 파라미터 수가 아니라, 다섯 회사와 두 정부를 빼면 거의 아무도 맞출 수 없는 자본 요구인 후속 학습 연산의 규모다. 가중치, 기술 보고서, 모델 카드는 최종 레드팀 검증 후 ’이달 말’에 나온다.

벤치마크는 Beam을 DeepSWE v1.1에서 44.4, Terminal Bench v2.1에서 80.1, SWE-bench Verified에서 80.9, AIME 2026에서 97.8, 도구 없이 HLE에서 36.2로 둔다. Reflection 자신의 설명은 이런 글이 좀처럼 보이지 않는 방식으로 정직하다. GLM 5.2와 경쟁력이 있고 Qwen 3.8 Max에 접근 중이며, 순수 능력에서는 Kimi K3가 앞서고, Beam의 주장된 우위는 추론 시점 효율이라는 것. 벤더가 자기 능력은 2등이고 비용은 1등이라고 말할 때는 앞의 절반을 믿어라.

이 스레드는 HN이 모든 사전 출시 발표에 하는 두 가지를 한다. 첫째, 데모를 감사한다. 한 댓글러는 Beam의 ’일반화 실험’이 퍼즐을 두고 ’며칠밖에 안 됐으니 학습 데이터에 나올 수 없었다’고 주장하는 걸 잡아낸다—다른 댓글러들은 그 퍼즐을 더 일찍부터 기억하고, 논점은 그것으로 RL을 하지 않았다는 약한 형태로만 살아남는다. 둘째, 주체를 감사한다. 한 댓글러가 Reflection이 어떤 조직이냐고 묻고, 답은 Misha Laskin(DeepMind Gemini의 보상 모델링)과 Ioannis Antonoglou(AlphaGo 공동 창시자), 2024년 3월 출시, 20억 달러 조달이다. 그러고는 누군가 DeepSeek V4.1 Flash와의 비교 표를 만든다—총 552B 대 501B, 프리필 활성 8B 대 23B, 사전학습 토큰 45T 대 28T, 그리고 출시일 가중치 제공 대 이달 말. 말은 싸고 이건 뒷받침하는 게 아무것도 없는 상당히 무의미한 발표라고 한 댓글러가 쓴다. 그가 맞고, 그럼에도 이번 주 가장 많이 논의될 모델 릴리스일 것이다.

Opus 5.5 에이전트가 상온 자기 반도체 후보 두 개를 발견 — 475 points

475 points · 322 comments · vals.ai · HN discussion

Vals.ai는 스핀트로닉 메모리용 반강자성 반도체 후보 두 개를 공개했다. Claude Opus 5.5 에이전트 팀이 찾아냈는데, 하나는 처음부터 설계한 화합물이고 다른 하나는 1999년에 처음 합성된 것이다. 둘 다 순자성이 0이면서도 전자를 스핀으로 분류할 것으로 예측되며, 그것이 보통의 반강자성이 갖지 못한 성질이고 MRAM 연구자들이 그것을 원하는 이유다. 글은 전체 계산, 코드, 알려진 주의사항 목록을 함께 공유한다. 마지막 항목이 이 글에서 가장 믿을 만한 부분이다.

문제는 입문 설명에서 시작된다. 물리학자 댓글러는 누구나 반자성체와 상자성체도 접하는데 자성체 두 종류만 제시하는 서론이 기이하다고 말하고, 다른 이가 진단을 내린다. Claude가 쓰고 아무도 검토하지 않으면 이렇게 된다는 것. 실질적 반론은 그 일을 해본 사람에게서 나온다. 이론가들은 그의 박사 과정 내내 고온·저온 초전도체 후보를 끊임없이 만들었고, 어려운 부분은 재료를 합성하는 것이다. 온도 제어실에서, 기계 아래 30톤 콘크리트 완충재를 놓고 CVD로 한 층씩. 예측은 싸다. 아무도 만들지 않은 예측된 화합물은 DOI가 붙은 가설일 뿐이다.

그래서 스레드는 제대로 갈라진다. 한 진영은 LK-99 이후라면 트럭 한 대 분량의 소금이 필요하다고 말하며, 아이디어를 갖는 것과 그 아이디어에 가치가 있음을 입증하는 것의 차이를 지적한다. 다른 진영—LK-99를 몇 년 만에 인터넷이 가진 최고의 재미라고 부르는 바로 그 진영—은 ’LLM이 X를 발견했다’에 대한 회의는 정당하되 그 밑의 방법은 여전히 지켜볼 가치가 있다고 주장한다. 풍자가 이 글에서 가장 날카롭다. 한 댓글러는 자기 에이전트 클러스터가 어젯밤 상온 핵융합을 발견했다고 보고하며, 주간 한도의 13퍼센트도 겨우 썼다고 덧붙인다. 여기서 실제 발견은 그것이다. 자성체 후보를 생성하는 비용은 거의 0이 됐고, 하나를 검증하는 비용은 전혀 움직이지 않았으며, 이 글은 첫 번째 사실이 두 번째 사실을 대신하는 시연이다.

2026년 노벨 물리학상: Francis Halzen — 444 points

444 points · 144 comments · nobelprize.org · HN discussion

2026년 물리학상은 한 사람에게, 1/1 상금 지분으로 돌아간다. University of Wisconsin–Madison의 Francis Halzen, ’IceCube 중성미자 관측소에 대한 결정적 기여와 천체물리학적 기원의 고에너지 중성미자 발견’으로. 계측 상이며 지급까지 38년이 걸렸다. Halzen과 J. Learned는 깊은 극지 얼음을 표적과 체렌코프 복사체로 동시에 쓰는 아이디어를 1988년 6월에 발표했다. 첫 센서는 1992년 빙하에 들어갔다. AMANDA는 설계대로 작동했지만 너무 작았다. IceCube는 2011년 완전한 1세제곱킬로미터에 도달했다—86개 케이블에 광센서 5,160개, 약 2킬로미터 깊이—Halzen이 1999년 NSF 원래 제안서부터 수석 연구책임자였고 그 제안은 2002년에 지원됐다.

발견 자체는 운 좋은 부산물이었다. 2013년, 2페타전자볼트 사건 두 개(1.04와 1.14 PeV)가 2010년 5월부터 2012년 5월까지 수집된 ‘시작 사건’ 데이터에서 우연히 나타났는데, 협업단은 전혀 다른 것, 엑사전자볼트 규모를 찾고 있었다. 가장 최근 발표된 결과인 2026년 3월 것에는 2019년에 기록된 하향 뮤온 중성미자 11.4 PeV가 포함된다—IceCube가 발표한 가장 높은 에너지의 중성미자다. IceCube는 NSF가 관리하는 시설로 14개국 58개 기관에서 약 450명이 참여하며, 수상 사유는 외로운 한 이론가를 암시하지 않고 협업단의 작업을 조심스럽게 명시한다.

이 스레드는 평균적인 수상 스레드보다 낫다. 정정이 곧 내용이기 때문이다. 체렌코프 복사를 설명하는 한 댓글러는 입자가 빛보다 빠르게 간다고 말하고, garyrob이 제대로 고친다—그 매질 안에서 빛보다 빠르게—물리 오류와 정의의 차이다. 다른 이는 세상에서 가장 긴 물류 사슬의 끝에 있는 공사 현장에 도대체 무거운 게 어떻게 도달하느냐고 묻고 South Pole Traverse라는 답을 받는다. 2009년 공사를 도우러 내려간 한 댓글러는 그동안 중성미자를 하나도 보지 못했다고 적는다. 또 한 명은 데이터 처리 기계에 Debian을 설치하러 남극점까지 날아간 동료를 묘사하는데, apt와의 관계에 따라 과학에서 최고의 직업이거나 최악의 직업이다.

Polars 2.0 — 355 points

355 points · 80 comments · pola.rs · HN discussion

Polars 2.0은 아웃오브코어 디스크 스필, 새로운 Map dtype, 더 엄격한 dtype 처리와 명시성, 그리고 한 무더기의 옵티마이저 작업—조인 재정렬, 공통 서브플랜 제거, 동적 프레디킷과 블룸 필터—을 내놓는다. 여기에 전략적 행보가 있다. SQL을 일급 시민으로 만드는 것. 글은 Polars가 이제 TPC-H와 TPC-DS의 스케일 팩터 10과 100에서 DuckDB 1.5.6, DuckDB 2.0 알파, DataFusion 54를 앞선다고 주장한다. 각각 다섯 번씩 핫 설정으로 실행하고, 다섯 번 중 최고를 취하고, 60초 타임아웃을 두고, 엔진 사이에 파일 캐시를 지우고, 16-vCPU 기계와 192-vCPU 기계에서. 방법론은 대부분의 벤더 글보다 자세히 공개됐는데, 벤더가 쿼리를 고른 벤치마크에서 요구할 수 있는 최대치다.

올바른 해석은 TPC 벤치마킹을 해온 댓글러에게서 나온다. 이런 글을 ’데이터베이스 A가 데이터베이스 B보다 X퍼센트 빠르다’로 절대 해석하지 마라. ’우리가 엔진에 집중적으로 작업을 넣었고 특정 워크로드가 개선될 것으로 기대한다’로 읽어라. 비판이 아니다. 벤더 벤치마크의 유일하게 정직한 사용법이며, 차트보다 유용하다. 스레드의 실용적 내용은 어차피 마케팅보다 낫다. 한 댓글러는 1 Billion Row Challenge에서 pandas가 4분 28초인 데 반해 Polars가 5.04초, DuckDB가 5.19초이며 DuckDB가 메모리를 19배 적게 썼다고 보고하고, 다른 이는 지리공간을 예외로 두면 Polars가 99.9퍼센트의 경우에 pandas 완전 대체품이라고 말하며(Geopolars는 개발 중), 세 번째는 벤치마크와 완전히 모순된다—DataFusion은 자기들 워크로드에서 항상 Polars를 앞섰고 DuckDB는 훨씬 뒤처졌다.

해결되지 않은 문제는 도입에 중요한 그것이다. SQL 지원 범위가 이제 일급이지만 asof_join()은 SQL에서 도달할 수 없고, ‘Polars 전용’ 연산 부류가 바로 마이그레이션 비용이 떨어지는 곳이다. 릴리스 후보에서 수십억 개의 날씨 점수를 돌리는 한 프로덕션 사용자는 목숨을 살려줬다고 말하는데, 그것은 이미 확신한 사람의 데이터 포인트 하나다. ’엔진이 더 빠르다’와 ‘당신의 코드베이스가 옮겨진다’ 사이의 격차는 TPC-H로 측정되지 않는다.

Example.com이 수십 년 만에 최대 리디자인을 방금 시작했다 — 318 points

318 points · 213 comments · debugbear.com · HN discussion

9월 28일, example.com—IANA가 문서용으로 예약해 둔 도메인이며 이십 년간 정적인 영어 페이지였던—이 더 이상 정적이지 않게 됐다. 새 버전은 자바스크립트로 5초마다 영어, 아랍어, 중국어, 프랑스어, 러시아어, 스페인어 설명을 순환한다. 각 글자를 자체 span에 감싸고 CSS transition-delay를 증가시켜 불투명도가 글자 단위로 사라진다. 10월 3일에는 애니메이션이 사라지고 여섯 언어가 한꺼번에 렌더링되는데, 5초 순환이 느리게 읽는 사람이나 스크린 리더 사용자에게 적대적이라는 피드백 뒤였다.

IANA의 설명은 전문이 인용되며, 대역폭에 관한 것이다. 사이트 트래픽이 많아서 페이지 내용을 기본 페이지와 이를 보강하는 별도 자바스크립트 파일로 나눴다는 것. 가능한 가장 우스운 결과다. 자기에게 의존하지 말라고 알리는 게 존재 목적인 플레이스홀더가, 자기를 의존하는 모든 것에서 오는 트래픽에 맞춰 최적화된 것이다.

그것은 사례 연구로 서술된 하이럼의 법칙이고, 스레드가 그 증거다. 한 댓글러는 즉각적 희생자를 지적한다. 페이지 텍스트에 단언을 걸어둔 자동화 테스트. 다른 이는 고전 디자인의 복제품을 자기 공개 엔드포인트 테스트 서버에 만들어 사람들이 안정적이고 오픈소스이며 자체 호스팅 가능한 무언가에 테스트를 겨눌 수 있게 했다. 세 번째는 example.com이 애초에 쓰이는, 겉으로 드러나지 않는 이유를 설명한다—SSL/HSTS를 제시하지 않아서 캡티브 포털 감지 경로를 작동시키는 몇 안 되는 깨끗한 방법 중 하나가 되고, 인증서 피닝이 대안들을 망가뜨렸다는 것. 내가 가장 좋아하는 건 거의 흰 페이지를 안경 얼룩 확인에 쓰던 사람인데, 리디자인이 자기 브라우저에서 기본으로 어둡게 렌더링돼서 이제 망가졌다는 것이다. 누군가 즉시 대체품을 제안한다. 기사에 실린 IANA의 ’성명’은 앞선 이메일을 편집한 것으로 한 댓글러는 이를 교활하다고 본다. 플레이스홀더에 언어 목록을 추가한 것이 캡티브 포털 도구 하나, 안경 닦기 루틴 하나, 그리고 알 수 없는 수의 CI 파이프라인을 망가뜨렸다. 이 페이지의 다른 어떤 것도 모든 공개 URL을 지원되는 API로 취급하라는, 혹은 십 년에 한 번 일부러 플레이스홀더의 디자인을 바꿔서 사람들이 힘든 방식으로 배우게 하라는 주장에 더 나은 사례가 되지 못한다.

우리 집의 램프들 — 309 points

309 points · 117 comments · arslan.io · HN discussion

사진과 함께하는 디자이너 램프 컬렉션 투어이며, AI는 어디에도 없다. Artemide Tolomeo Mini(Michele De Lucchi와 Giancarlo Fassina, 1987, 1989년 Compasso d’Oro), 아마 역대 가장 많이 따라 만들어진 데스크 램프. Tizio Micro(Richard Sapper, 1972)—팔을 따라 배선이 없는데 팔이 전류를 나르기 때문이고, 추 덕분에 손가락 하나로 움직이고 그대로 멈추며, Sapper가 검은 제품에 서명처럼 쓴 작은 빨간 디테일—나중에 ThinkPad에 빨간 TrackPoint를 붙인 것과 같은 본능이다. Akari 1A와 3A, Isamu Noguchi의 화지 조각으로, 1951년 기후를 방문한 뒤 시작한 시리즈의 것이며 ’akari’는 조명과 가벼움을 동시에 뜻한다. 저자는 그중 어느 것도 저렴하지 않았고 실용성 면에서 값어치가 없을 것이며, 어느 시점에 이것이 수집이 됐고, 좋은 가격은 빈티지 숍과 박람회에 있다고 분명히 말한다. 그는 또한 Tolomeo가 USM Haller 책상에 직접 장착되도록 어댑터를 설계했는데, 이 글에서 가장 엔지니어다운 부분이다.

스레드는 취향을 하나의 범주로 바꾼다. 최고의 댓글은 매립형 천장 조명이 인간이 신경 쓰는 차원에서 위계를 세우지 못하며 눈높이의 빛이 접근성과 편안함의 문제라고 지적하는 사람의 것이다. 전직 조명 디자이너가 그 용어가 업무 조명(task lighting)이며 차이가 미묘하지 않다고 확인한다. 그러고는 HN이 하는 대로 한다. 한 댓글러는 1,255달러짜리 Muuto Post가 기숙사 가구처럼 보인다고 하고, 다른 이는 그 안의 유리 블록이 몇 달러에 구할 수 있다고 지적하며 3D 프린트 케이스로 15달러 미만에 동급을 만든 경험을 설명하고, 세 번째는 3D 프린터 핫엔드 수리를 위한 작고 밝은 작업등을 요청해 구체적인 하드웨어 답 세 개를 받는다. 램프 글이 조명 디자인 세미나가 되고 나서 구매 가이드가 됐다. 이것이 프론트페이지의 용도이고, 오늘 아무것도 발표되지도, 벤치마킹되지도, 다투어지지도 않는 유일한 이야기다.

Competitive Programmer’s Handbook (2018) [pdf] — 291 points

291 points · 71 comments · cses.fi · HN discussion

Antti Laaksonen의 핸드북, 296쪽, 2018년 7월자 초안이 적어도 네 번째로 프론트페이지에 다시 떠오른다. 제목이 시사하는 범위를 C++로 다룬다—시간 복잡도, 정렬과 이진 탐색, 자료 구조, 동적 계획법, 그래프 알고리즘—cses.fi에 짝을 이루는 문제 세트가 있고, 조판된 판을 원하면 상업 출판된 더 다듬어진 Springer판이 있다. Laaksonen이 자기 강사 중 한 명이라고 댓글을 단 학자는 강의가 CS의 뼈대와 핵심을 파고들어 10배는 똑똑해진 기분이 들게 한다고 묘사하는데, 다운로드 수보다 나은 추천사다.

오늘 이 글이 한 줄 이상의 가치가 있는 이유는 최상위 댓글이며, 그것은 책과 아무 관련이 없다. 한 개발자는 매일의 과도한 에이전트 사용에서 벗어나는 해독제로 여가에 Codeforces, Rosalind, Codewars, LeetCode를 하고 있으며, LLM에 대한 과도한 의존이 잊게 만든 것들을 다시 배우고 있고, 열심히 생각해서 해답에 도달하는 느낌이 그리웠다고 말한다. 그는 우리가 종으로서 그 욕구를 잃지 않기를 바란다. 답글은 한 줄로 된 반론이다. LLM의 부상은 대부분의 사람이 애초에 그 욕구를 가진 적이 없으며 소수만이 가졌음을 보여줬다.

그 주고받음은 이 모든 것이 실력에 무엇을 하고 있는지에 관해 오늘 페이지에서 가장 정직한 산물이다. ’AI가 프로그래머를 대체할까’가 아니다—여기서 그렇게 주장하는 사람은 없다—도구가 더 빠를 때 어려운 문제를 푸는 특정한 즐거움이 살아남느냐다. 스레드의 누구도 명시적으로 말하지 않는 이차적 관찰: 이 핸드북이라는 장르 자체가 연습이 중요하기 때문에 존재하고, 그 연습이 아웃소싱되는 부분이다. 특히 이 책이 학습자에게 너무 간결하다고 주장하는 댓글러들이 대안을 추천하는데—Zingaro의 Algorithmic Thinking—그것은 주의력의 부족 문제이지 재료의 부족 문제가 아니다.

Deno와의 우정은 끝났다, 이제 Node가 내 가장 친한 친구 — 291 points

291 points · 213 comments · dbushell.com · HN discussion

David Bushell은 Deno에서 몇 년을 보낸 뒤 SvelteKit 클라이언트 프로젝트를 위해 Node로 돌아왔고, 놀라운 건 그가 떠나온 이유들이 더 이상 존재하지 않는다는 것이다. require()는 그의 코드에서 사라졌고, 현대적 API는 지원되며, fnm이 버전 전환을 처리하고, Node는 TypeScript를 네이티브로 실행한다—철학적 예외가 하나 있는데, Node 문서에서 인용하면 node_modules 아래 파일에 대해서는 타입 스트리핑이 거부된다. 프로젝트가 저자들이 TypeScript로 작성한 패키지를 배포하는 것을 막고 싶어 하기 때문이다. 오류 코드는 ERR_UNSUPPORTED_NODE_MODULES_TYPE_STRIPPING이다. 그의 해석은 이것이 Microsoft 색채의 생태계 오염 통제이며, 런타임의 한계가 아니라 정책이라는 점을 분명히 한다.

공급망 단락이 훔칠 만한 부분이다. 그는 즉시 털리지 않으려고 pnpm으로 갈아탔고, minimumReleaseAge: 1440과 trustPolicy: no-downgrade를 설정했으며, pnpm은 설치 후 스크립트를 차단하지만 NPM은 여전히 실행한다고 지적하고, 한 달은 의존성 해석을 깨기에 충분히 길어서 하루 지연으로 정했다고 말한다. ‘다음 Shai-Hulud를 다른 얼간이가 베타 테스트하게 하기에 충분히 긴’ 것이 npm 웜 시대 전체에 대한 올바른 프레임이다. 방어는 검토가 아니라 지연이고, 누군가 다른 이가 카나리아가 되기를 바라는 것이다. 그가 필요한 모든 닷파일이 실수 하나씩 더 늘어난다고 그는 쓰며, tsdown이 추가한 두 개가 마음에 들지 않는다.

스레드의 최고 정보는 Deno의 쇠퇴에 관한 것이며, 표준 라이브러리를 계약으로 작업한 사람에게서 나온다. 구조조정 이후 로드맵도 소통도 없고, 지켜보기 슬프다고. 한 답글은 Deno의 유일하게 현명한 수가 인수되는 것이었고, 팔거나 밀려나거나 둘 중 하나라고 주장한다. 반박은 Deno가 여전히 지루한 부분에서 이긴다는 것이다—내장 테스트 러너, 린터, 포매터, 타입 체커, 배포용 JSR—그리고 Node에는 그 어느 것에도 뚜렷한 답이 없다. 그것이 2026년 런타임 전쟁의 모양이다. Deno의 아이디어가 이겼고, Node는 지는 대신 흡수해서 그것을 얻었다—브라우저 전쟁도 항상 그렇게 끝났다. 글의 부정성이 신뢰도를 깎았다고 말하는 댓글러가 맞고, 그것이 결론을 바꾸지는 않는다.

SF의 두 지점 사이에서 가장 평탄한 경로를 찾아라 — 287 points

287 points · 100 comments · flattensf.com · HN discussion

Drew Edwards는 목적 함수가 거리가 아니라 누적 상승인 경로 탐색기를 만들었다. USGS 1미터 라이다 고도와 Overture/OpenStreetMap 그래프를 사용해 브라우저에서 160,000개 도로 구간 위에서 돈다. 하나의 경로를 반환하는 대신 최단과 최평탄 사이의 파레토 프런티어를 따라 슬라이더를 노출한다—두 기준 모두에서 다른 무엇도 이기지 못하는 모든 경로, 가장 빠른 길에서 걸을 만한 길까지, 상승 1피트가 도보 200피트로 매겨진다. 오른쪽으로 밀어도 경로가 짧아지지 않고 상승이 늘지 않는다. 도보에서는 계단이 허용되고 자전거에서는 제외된다. SFMTA 자전거도로망을 이용해 쾌적함으로 거리를 재는 ‘조용한 길 선호’ 모드가 있다. 보호 차로는 길이의 0.8, 조용한 길은 1, 차로 없는 번잡한 간선도로는 1.4에서 2로 센다. 장소 검색은 페이지에 구워 넣은 데이터에 대해 오프라인으로 실행된다.

이것이 페이지에서 가장 잘 만든 장난감인 이유는 두 가지다. 첫째, 목적 함수를 의도적으로 골랐고 트레이드오프를 숨기지 않고 드러낸다. ’가장 평탄한’은 명세가 부족한데, 저자는 추측하는 대신 프런티어 전체를 준다. 스레드의 최고 반론이 정확히 그것이다. 한 댓글러는 총 상승이 아니라 경사를 최소화하기를 원해서, SOMA에서 Nob Hill로 갈 때 Taylor Street를 정면으로 공격하는 대신 동쪽이나 서쪽에서 접근하게 하자고 한다. 답글은 올바른 반박이다—최대 경사를 최소화하면 산을 무한 지그재그로 오르게 된다. 유한한 경로는 결코 충분히 평탄하지 않기 때문이다. 둘째는 유지보수 루프다. 한 댓글러가 Cabrillo Street에서 잘못된 경로를 보고하면, 저자가 스레드 안에서 진단하고, 샌프란시스코 Slow Streets의 ‘목적지만’ 태그가 보행자 통행 금지로 파싱되고 있음을 찾아내 고치고 배포한다—모두 공개적으로. 관객 앞에서 소프트웨어를 출시하는 좋은 버전이다.

스레드의 나머지는 늘 그렇듯 경로 잔소리와 도시 정치의 혼합이다. 한 댓글러는 Geary와 Divisadero에서 자전거를 타라는 말에, 살고 싶다며 거절한다. 저자는 이 도구가 아직 자전거도로를 모른다고 인정하고 SFMTA 네트워크를 가져오겠다고 말한다. 누군가는 이스탄불에서 같은 것을 요청하는데, 진짜로 더 언덕이 많은 문제다. 누군가는 25센티미터 3DEP 고도 데이터가 S3에서 무료로 제공되며 DEM 정확도 불만을 해결할 것이라고 지적하고, 저자는 반박하지 않는다. 이 도구는 주장하는 바에 완벽하지 않다. 자신이 만드는 트레이드오프에 정직하고, 그래서 사람들이 무시하는 대신 소수점 둘째 자리로 다투는 것이다.

종이 사라질 때 자연이 ‘되튀는’ 능력은 과대평가됐다 — 264 points

264 points · 129 comments · phys.org · HN discussion

이런 종류의 가장 큰 종합 연구로, Nature Ecology & Evolution에 발표됐고 King’s College London이 Imperial College London, Natural History Museum, Alan Turing Institute와 함께 주도했다. 423개 연구, 222,829개 데이터 포인트, 생태계 서비스와 기능 23개 범주, 육지·담수·해양·기수—이전 최고 시도의 두 배가 넘는 데이터베이스다. 발견은 부정적이다. 23개 범주 전반에서 대부분의 편익은 종이 몇 개 있으면 평평해지는 대신 생물다양성과 함께 계속 상승하며, 이는 기능적 중복성—종이 서로를 대체할 수 있고 손실이 큰 해를 끼치지 않는다는 가정—이 과대평가됐음을 의미한다. 생태적 편익은 다양성이 오르면 오르고, 떨어지면 떨어진다.

논문 자체의 단서가 그것을 진지하게 받아들일 이유다. 해양 탄소 격리는 측정된 어느 서비스보다 훨씬 강한 민감도를 보이며(대기질 조절의 −0.03에 대비해 Fisher의 z가 1.48), 그 결과는 육상 탄소 격리의 154개에 대비해 데이터셋 일곱 개에 기대고 있다—저자들은 이를 묻어두는 대신 긴급한 공백으로 지목한다. 세계가 블루 카본에 기대고 있다면 해양 생물이 나중에 생각할 것이 될 수 없다고 주저자는 말하며, 그 문장의 정직한 버전은 우리에게 그것에 관한 연구가 일곱 개뿐이라는 것이다. 반례도 똑같이 교훈적이다. 위험 조절은 생물다양성에 둔감해 보이는데(r²가 0.17) 모래언덕 안정화가 한두 개 기초 관목 종에 의해 이루어지기 때문이다. 다양성이 일률적으로 보호적이지는 않다. 어떤 서비스는 특정 분류군에 인질로 잡혀 있고, 논문은 그렇게 말한다.

스레드의 가장 강한 기여는 평형 은유 자체에 대한 회의다. 한 댓글러는 Adam Curtis의 All Watched Over by Machines of Loving Grace를 추천하며, 자연 평형이라는 생각이 생태학에 투영된 1950년대 사이버네틱스 판타지라고 주장한다. 세계를 시스템 언어로 모델링하면, 그저 더 오래 기다리면 시스템이 평형으로 돌아온다고 주장할 수 있다는 것. 다른 댓글러는 거울상 오류—’모델은 틀렸다’는 반사는 반례를 골라 모아 눈을 멀게 한다—를 경계하는데, 붙일 만한 올바른 단서다. 그러고는 대구 어업이 실증 사례로 등장한다. 붕괴 후 규제가 개체군이 돌아오게 놔뒀지만 돌아오지 않았고, 그 생태적 지위는 다른 종으로 채워졌다. 한 답글이 말하듯, 자연이 되튄 이야기이긴 한데 그것을 관리하던 사람들이 생각한 방식은 아니었다. 여기서 논문에 반박하는 것은 없다. 편안한 단어 ’되돌아온다’에 반박한다.

Dust: 역전파 없이 트랜스포머 사전학습 — 257 points

257 points · 73 comments · qlabs.sh · HN discussion

Dust는 0차 훈련 방법으로, 모든 토큰에서 활성값을 독립적으로 섭동한다—노드 섭동—그래서 각 토큰이 가상의 개체군 구성원처럼 작동하고 한 번의 순전파가 그것들을 모두 병렬로 평가한다. 주장된 결과: 역전파와 정렬되고 개체군이 커질수록 개선되며 때로는 역전파를 넘어서는 그래디언트 추정치, 최대 10억 토큰의 테스트까지; 더 큰 모델이 개체군 효율이 더 나은(더 나쁜 게 아니라) 것, 2억 4,300만 파라미터 모델이 대부분의 개체군 크기에서 120배 작은 모델을 이기는 것; 그리고 외삽에 기반해 100만 토큰 이상에서 가중치 공간 진화 전략보다 10³에서 10⁴배 나은 효율. 프레임은 Bitter Lesson 극대주의다—미분가능성과 역전파를, 연산이 풍부할 때 그 제약이 값을 잃는 저연산 귀납적 편향으로 보는 것.

세부 조항을 읽어라. 세부 조항이 곧 논증이다. Dust는 ‘큰 개체군(즉 상당히 더 많은 연산)에서’ 역전파를 근사하고, 외삽으로 하나의 특정 베이스라인인 EGGROLL보다 몇 자릿수 더 효율적이다. 그것은 ’역전파와 경쟁력 있다’와 같은 주장이 아니며, 이 글은 제목보다 이 점에 대해 더 꼼꼼하다. 외삽이 실제 일을 하고 있다. 효율 배수는 이것이 문제가 될 규모에서 측정된 게 아니라 투영된 것이다.

스레드는 올바른 종류의 적대적이다. 몇 년마다 미분 없는 최적화가 하이프되는 것을 지켜본 한 댓글러는 그것들 중 어느 것도 영향력을 내지 못할 것에 전 재산을 걸겠다고 말한다. 신경망 목적 함수는 매끄럽고 그래디언트가 무작위 방향보다 엄격히 더 나은 신호이기 때문이다. 가장 날카로운 답글은 이것이 양자택일이 아니라는 것이다. 그래디언트는 수치적으로 계산될 수 있으므로, 비용 함수를 샘플링하는 어떤 방법이든 필요할 때 그래디언트를 복원할 수 있다. 세 번째는 Bitter Lesson 프레임이 성립하지 않는다고 반박한다. 0차 방법은 비볼록성을 다루지 않기 때문이다—Dust는 지형을 매끄럽게 만들고, 매끄러운 규칙은 이미 1차 방법에 적용되므로 비볼록성을 제거하면 이점이 증발한다. 스레드 최고의 스틸맨은 0차 작업을 대체물이 아니라 역전파가 구조적으로 약한 영역을 위한 기법으로 보고, 활성 공간 탐색을 사용해 역전파용 교수 목표를 생성하자고 제안하는 사람의 것이다. Dust가 스케일하든 안 하든, 5년 후에도 여전히 중요한 이 연구의 버전이 그것이다.

Gleam은 더 이상 Erlang 소스로 컴파일하지 않는다 — 252 points

252 points · 103 comments · gleam.run · HN discussion

Gleam v1.19.0은 Erlang 코드 생성기를, Erlang 소스 대신 Erlang 추상 폼(abstract forms)을 내보내는 것으로 교체한다—Erlang 컴파일러의 파서가 보통 생성하는 메타데이터 주석이 달린 IR로, 외부 텀 포맷으로 이진 인코딩되며, Gleam이 생성된 코드를 컴파일러의 뒷부분에 직접 로드할 수 있게 한다. 이득은 구체적이다. 더 빠른 컴파일, 그리고 원래 Gleam 줄을 가리키는 스택 트레이스와 BEAM 크래시 리포트(가장 가까운 함수 경계가 아니라)—위치 메타데이터가 이제 Gleam 소스를 기술하기 때문이다. 또한 완전한 디버거 지원을 서드파티가 손에 넣을 수 있게 하고, 아무도 ’트랜스파일러’를 경멸어로 쓰지 못하게 하겠다는 Louis Pilfold의 공언한 야망도 끝낸다.

벤치마크는 José Valim의 langcompilebench에서 가져온 함수 100개짜리 모듈 100개이고, 글은 벤치마크가 인위적이며 이 형태는 언어의 일부만 훈련한다고 분명히 말한다. 그 단서가 방향은 믿고 숫자는 믿지 말아야 할 이유다.

가장 유용한 단일 댓글은 정정이다. 제목은 Gleam이 Erlang이 쓸 수 있는 무언가를 더 이상 만들지 않는 것처럼 들리게 한다. 그렇지 않다—출력이 더 낮은 수준의 포맷으로 옮겨갔고, 같은 IR이 Elixir가 컴파일되는 대상이며 Erlang의 파스 트랜스폼이 조작하는 것이므로, 하나라도 작성해본 사람이라면 이미 Gleam의 출력을 읽는 법을 안다. 저자는 스레드에서 LFE도 같은 방향으로 옮겨갔다고 확인한다. 스레드의 나머지는 이 언어를 위한 사례를 쌓는 커뮤니티다. Gleam 20만 줄을 유지하는 사람은 Discord가 자기 가장 멍청한 질문조차 견뎌줬다고 말하고, 한 댓글러는 재작성을 한 기여자가 자존심 없이 작업을 공개 스트리밍한 것을 칭찬하며, 요청은 모두 도달 범위에 관한 것이다—네이티브 타깃, wasm, WASI. 작고 일부러 지루하다는 게 세일즈 포인트인 언어에게, 이 릴리스는 화려하지 않은 종류의 진보다. BEAM 생태계 밖에서는 아무도 알아채지 못할 컴파일러 변경이, 앞으로의 모든 스택 트레이스를 올바르게 만든다.

베스트셀러 Zigbee 온도 센서 테스트 및 비교 — 206 points

206 points · 112 comments · smarthomescene.com · HN discussion

베스트셀러 Zigbee 온습도 센서 열두 개—Aqara, Sonoff, Tuya, ThirdReality, Zemismart, Moes, 대부분 AliExpress에서 조달—를 하나의 보정된 기준기에 맞대어 비교한다. 기준기는 pvvx 커스텀 펌웨어를 돌리는 Xiaomi Miaomiaoce MHO-C401로, 정육점 상업용 냉장고에 있고 주에서 석 달마다 검사하는 실험실 인증 온도계에 맞춰 보정됐다. 맞추려면 −0.5°C와 습도 +4퍼센트 오프셋이 필요했고, 저자는 이 기준점을 약 4°C에서 잡았으므로 상온에서 직선 정확도를 보장하지 않는다고 분명히 한다—보장하는 것은 동일 조건에서 센서를 비교할 일관된 기준이고, 어차피 센서는 Home Assistant에서 재보정할 수 있다. 테스트는 PoE 코디네이터, 3.5미터 간격, 다른 페어링 기기 없이, Zigbee2MQTT 2.12.1-dev의 새 Zigbee 네트워크에서 이뤄졌다.

이것이 페이지에서 가장 가치 높은 하드웨어 방법론인 것은 바로 지지할 수 있는 것 이상을 주장하지 않기 때문이다. 여섯 브랜드의 열두 개 제품, 디스플레이 없음, 전부 배터리 구동. 차별점은 정확도, 범위, 제작 품질, 배터리 종류, 폼팩터이고, 후속편은 저렴한 센서가 실제로 실패하는 온도에서 냉장고 벤치마크를 추가했다.

그러고는 스레드가 리뷰가 무엇을 측정했어야 하는지 논쟁한다. 한 댓글러는 센서 다이와 MCU를 공개하기를 원한다—Bosch, Sensirion, 서미스터—정확도와 배터리 수명을 결정하기 때문이다. 답글은 추상적으로 맞다. 구매자는 어차피 제품 안에 무엇이 있는지 확인할 수 없고, 한 SKU 안의 개체 간 편차가 중국산과 서양 부품의 차이보다 크다. 더 실용적인 메모는 배터리와 수명 주기에 관한 것이다. IKEA 센서는 코인 셀 대신 AAA 전지를 쓰고, 한 댓글러의 IKEA Thread 제품은 배터리 수명이 형편없고 설정 가능한 갱신 주기가 없으며, 냉장고 안에 저렴한 센서를 넣어본 사람은 모두 그것이 킬러 앱이라는 데 동의한다. 한 댓글러는 한여름 절반 동안 조용히 10도에서 15도 사이에 머물던 냉장고를 추적했고, 다른 이는 문이 닫히는 것을 막던 상자를 찾아냈다. 5달러 센서와 알림 규칙 하나가 십 년간 문을 열어보는 것으로는 잡지 못한 고장을 잡아냈다. 이것이 이 범주 전체의 명분이고, 증명하는 데 벤치마크는 필요 없다.

페이지에도 함께 오른 것들

Kolibri: 주권 오픈 웨이트 모델 — 699 points · 336 comments · aleph-alpha.com — 오늘 가중치가 딸린 유일한 발표: 780억 파라미터, 활성 30억의 영어-독일어 전문가 혼합 모델로 1M 토큰 컨텍스트를 가지며, 지금 Hugging Face에서 Apache 2.0으로 내려받을 수 있고, 이전 30B 모델과 하드웨어 장애에서도 살아남는 무인 사전학습으로 수백 회의 절제(ablation) 실험으로 검증된 파이프라인 위에 세워졌다. 스레드에서 흥미로운 부분은 기술 보고서가 현대적 에이전트 LLM을 만드는 방법에 관한 튜토리얼처럼 읽힌다는 것, 데이터셋 구성 방법까지 포함해서다. 기억할 만한 정정 두 가지: 한 댓글러는 주권에 이렇게 투자한 글이 회사의 예정된 Cohere 합병을 언급했어야 한다고 지적한다. 미국도 중국도 아닌 이런 연구소들이 점점 노력과 비용을 나눠야 하기 때문이다. 그리고 Kolibri 자체 하네스로 Kolibri 자체 벤치마크에서 낸 벤치마크 주장은 독일어에서 Qwen 3.8 27B가 79.9 대 70.8로 그것을 이긴다. Kolibri는 절제(abstention) 데이터로 학습돼 맥락에 답이 없으면 ’모른다’고 말하는데, 그 위의 대부분 숫자보다 유용한 제품 기능이다.

JetBrains, 2025년 매출 성장과 순손실 보고 — 553 points · 505 comments · helgilibrary.com — 매출 160억 체코 코루나, 6.3퍼센트 증가로 사상 최대, 순손실 3억 1,500만 코루나, 자기자본이익률 −11.1퍼센트, EBITDA 마진 5.73퍼센트, 대차대조표에 순현금 76억 코루나. 스레드는 손실을 거의 즉시 건너뛰고 대신 전략을 논쟁하는데, 그것이 맞다. 순현금과 사상 최대 매출을 가진 회사가 손실에 투자하는 것은 구조조정 사연이 아니다. 설득력 있는 비난은 JetBrains가 에이전트 IDE의 도래를 봤으면서 두 사람과 약간의 인턴으로 인력을 채웠다는 것이고, 반론은 diff와 내비게이션과 워크트리가 중요해서 여전히 JetBrains 터미널 안에서 Claude를 쓰는 사람들에게서 나온다. 505개 댓글 중 누구도 지목할 수 없는 것은 깊은 워크트리 지원, 병렬 세션, diff 리뷰를 명령줄보다 잘 하는 IDE인데, 그것은 크게 열린 제품 표면이거나 이 범주에 대한 평결이다.

Pi Durable — 510 points · 74 comments · earendil.com — Earendil은 10월 1일에 Pi 1.0을 내놓고 곧바로, 오래 실행되고 실패에서 살아남아야 하는 에이전트를 위한 실험적 하네스를 덧붙였다. 서로 다른 표면에서 도달 가능, 무한히 긴 대화, 치명적인 내부·외부 실패로부터의 복구, 같은 에이전트를 조종하는 여러 사람. 명시적으로 Pi 코딩 에이전트의 대체물이 아니라 그 pi-ai 코드와 미니멀리즘·유연성이라는 공언한 원칙을 공유하는 프레임워크다. 스레드는 경쟁 집합을 나열하고—LangChain Deep Agents, Vercel Eve, OpenAI의 Agents API, Anthropic의 관리형 에이전트—릴리스 노트가 광고하지 않는 설계 선택을 지적한다. Durable은 분기하는 대화 트리를 버리고 계보 정보를 지닌 포크를 택한다. 그것이 내구성 보장에 필요한 것인지 코딩 에이전트로부터의 후퇴인지가 열린 문제이고, 6개월 뒤 채택을 결정하는 종류의 문제다.

ChatGPT가 가짜 New Yorker 만화에 실제 만화가 서명을 붙이고 있다 — 533 points · 388 comments · niemanlab.org — Dolly Parton과 Tim Curry에 관한 한 만화가 ’New Yorker 스타일 만화’라는 프롬프트로 ChatGPT에 의해 생성돼 화면 구석에 실제 만화가 Brendan Loper의 필명인 ’BLOPER’가 붙은 채 퍼졌다. Loper는 그것을 그리지도 서명하지도 않았다. 그 트윗은 좋아요 25,000개를 받았고, Nieman Lab이 그 경험에 관한 만화를 그리도록 그에게 의뢰했다. 스레드의 기술적 설명이 맞다—학습 데이터가 그 화풍을 구석의 그 서명과 연관시키며, 누군가 서명을 특별하게 취급하도록 훈련하지 않는 한 모델이 그렇게 하게 만드는 것은 없다—그리고 법적 직관이 올바른 프레임이다. 인간이 다른 예술가의 서명을 위조하면 책임을 지며, 그것을 생성한 주체에도 마찬가지로 적용돼야 한다. Gwern은 추가 편집으로 가짜 서명을 지우지만 대부분의 사용자는 그러지 않을 것이라고 지적하는데, 이것이 확산되는 메커니즘이다. 한 엔지니어링 매니저는 스프린트 데모에 하나를 넣었다고 한다.

AI가 이제 자체 추론 하드웨어를 개발할 수 있다 — 159 points · 176 comments · github.com/FeSens/openTPU — openTPU는 읽을 만한 하나의 모노레포에 담긴 오픈소스 AI 가속기다. SystemVerilog 하드웨어, ISA, 비트 단위로 일치하는 시뮬레이터, 커널 언어와 컴파일러, 실제 PCIe 카드용 호스트 소프트웨어. Inspur YPCB-00338 카드(Xilinx Kintex-7 xc7k480t에 DDR3 채널 두 개)에서 실제 가중치로 모델 열 개를 돌리고 시뮬레이터와 비트 단위로 동일한 토큰을 생성한다. 헤드라인이 결과물보다 더 많은 일을 하고 있다—한 댓글러의 격하가 정확하다. 인간이 LLM에게 하드웨어 설계용 시뮬레이션 환경을 만들라고 프롬프트했고, 그 덕에 인간이 프롬프트할 때 LLM이 그 시뮬레이션의 제약에 맞춰 설계를 최적화할 수 있게 된 것이다. 최고의 기술적 반론도 스레드에 있다. 누군가 RTL을 열어 부동소수점 연산을 보고, LLM에는 정확한 부동소수점 연산이 필요 없는 모양이라고 결론 내리고 페이지를 닫았다. Kintex-7와 DDR3는 십 년 된 보드다. 성과는 루프와 읽을 만한 툴체인이며, 그렇게 팔려야 한다.

세계 최초의 강화 지열 발전소가 단 23개월 만에 완공 — 134 points · 54 comments · techcrunch.com — Fervo는 9월 30일, 하루 일찍, 유타주 Cape Station에서 전력 판매를 시작했다. 100MW 발전소의 첫 3분의 1이 전력망에 동기화됐고, 회사가 제시한 부지 잠재력은 4GW다. 착공에서 상업 운전까지 23개월이 걸렸고 향후 블록의 목표는 18개월인데, 이는 단계적 개발이 데이터센터를 짓는 방식과 맞기 때문에 중요하다. Google과 Southern California Edison이 전력 구매를 약속했다. 스레드는 마케팅을 걷어낸다. TechCrunch는 보도자료 요약처럼 읽히고, 강화 지열 프로젝트는 수십 개가 있으며, 바젤과 장크트갈렌의 스위스 시도 두 개는 지진을 일으킨 뒤 중단됐다. 이것이 재현될지 실제로 결정하는 숫자는 열적 드로다운이다—파쇄된 암석이 모델링보다 빨리 식으면 운영자는 계속 시추해야 한다—그리고 이 발전소는 아직 운전 이력이 없다.

Tapo (Rust/Python 라이브러리)가 이제 TP-Link의 TPAP 프로토콜을 지원한다 — 107 points · 45 comments · dinculescu.dev — 펌웨어 1.4.0부터 TP-Link의 Tapo 플러그와 전구는 앱에 숨겨진 ‘서드파티 호환성’ 스위치를 사용자가 켜지 않으면 서드파티 클라이언트를 거부해왔는데, 보안을 이유로 한 펌웨어 변경이 비공식 클라이언트를 차단한 세 번째 사례다. v0.11.1부터 그 스위치를 끈 상태에서도 비공식 Rust/Python 클라이언트가 작동한다. 역사적 맥락은 글에 있다. 2023년 L530E 전구 프로토콜에 관한 Catania/Royal Holloway의 공개가 통합을 깨뜨린 펌웨어 변경을 촉발했고, 사용자들은 이를 전부 ’내 코드는 아무것도 안 바뀌었는데 스크립트가 403을 반환했다’로 경험한다. 논평이 라이브러리보다 흥미롭다. 한 댓글러는 GLM 5.2 무렵부터 폐쇄 프로토콜 역공학이 싸졌다고 주장한다. 바이너리와 Ghidra의 MCP 통합만으로도 대부분의 길을 갈 수 있기 때문이다—그리고 같은 모델 능력 때문에 다른 댓글러는 그 글쓰기 스타일이 탐지 가능한 AI 쓰레기라며 읽기를 거부한다. 둘 다 2026년 생태계에 관한 하중을 지탱하는 사실이다.

Erdosproblems.com, AI의 공세에 굴복하다 — 29 points · 3 comments · erdosproblems.com — 작은 이야기, 불균형한 신호. Thomas Bloom은 인간 수학자들에게 문제 목록을 알리려고 erdosproblems.com을 만들었다. 문제가 진술하기 쉽고 생소한 것부터 심오한 것까지 걸쳐 있어서 우연히 AI 벤치마크가 됐다. 그는 이제 그 효과를 서술한다. 일부 수학자는 이 분야를 취미로 치부하고, 다른 이들은 AI와 경쟁할 수 없다고 믿어 에르되시 문제를 그만두며, 그리고—그를 글을 쓰게 만든 부분—사람들이 사이트와 상호작용하는 주된 방식이 이제는 설명 없는 AI 생성 증명을 광고하는 것이 됐다는 것. 점점 무의미해지는 우선권 주장을 걸기 위한 수단으로. 그가 운영하고 싶던 사이트가 아니다. 그는 무엇을 바꿀지에 대한 피드백을 요청한다. HN 제출자의 클릭베이트 제목이 이 글에서 가장 흥미롭지 않은 부분이다.

밀리초 단위 벤치마크 — 98 points · 22 comments · matklad.github.io — Alex Kladov의 경험 법칙: 마이크로벤치마크의 입력 크기를 약 300밀리초가 걸릴 때까지 조정하라. 세 자리 정수는 개선을 보기에 충분히 정확하고 훑어보기 쉽고, 수백 밀리초면 고정 오버헤드가 무의미해지며, 그 숫자는 인간이 지각할 수 있어 수감각 대신 직관을 쓸 수 있고, 1초가 넘으면 벤치마크를 반복하기에 너무 느려진다. 그가 밝힌 가정은 벤치마킹의 목적이 정밀한 측정이 아니라 올바른 결정을 내릴 만큼의 직관이라는 것이다. 스레드의 반박은 이 장르 전체에 대한 상시 비판이다. 신뢰 구간을 보고하고, 같은 실행에서 대조군과 라운드로빈으로 비교하거나, 워밍업과 안정화를 처리하는 프레임워크를 써라—실제 하드웨어에서는 그렇게 하지 않으면 클럭 스케일링, 인터럽트, 열 스로틀링이 재현 불가능한 숫자를 만들어내기 때문이다. 두 입장 모두 참일 수 있다. 정답은 당신이 원하는 숫자가 결정을 위한 것인지 주장을 위한 것인지에 달려 있고, 오늘 프론트페이지는 주장을 하는 사람들로 가득하다.

여전히 페이지에 남은 것들

200포인트를 넘긴 124개 이야기 중 90개는 이전 라운드업에서 다뤘다. 변동폭은 각 이야기를 마지막으로 추적한 라운드업 대비이며, 대부분은 어제 것이다.

그중 세 개가 문제가 될 만큼 움직였고, 두 개는 아무도 보지 않는 것들이다. 앤트로픽이 일기장 기록을 경찰에 신고 315 → 795, +480은 이 창에서 4배 차이로 최대 상승폭이며 댓글 630개, 36위에 있다. 웹 검색 API 391 → 581, +190이 두 번째로 41위. 덴마크 880만 명 데이터 유출 428 → 496, +68이 63위. 그다음 중간 무리: 4090에서 돌린 Qwen 3.8 Flash Next 904 → 921, +17, 어제의 473포인트 급등 이후; 구글 데이터센터 물 504 → 526, +22; 픽셀 11과 그래핀OS 363 → 426, +63; 애플 인텔리전스 제거 738 → 765, +27; 예산 상한 623 → 636, +13; Bob Cringely 926 → 936, +10; 전기기사 에세이 469 → 478, +9; 그리고 Kolibri 692 → 699, +7.

나머지는 모두 6포인트 이하로 움직였고, 거의 여든 개 이야기에 걸쳐 있다. 목록 상단은 거의 숨을 쉬지 않았다. Gemini 4 Argon 1,699 → 1,701, Pi 1.0 1,684 → 1,686, 유타주의 VPN 판결 804 → 808, MCP는 안 된다고 했잖나 682 → 686, Mike Tomlin의 마인크래프트 도시 672 → 675, Clef 638 → 640, iOS용 StreetComplete 629 → 630, Git 3.0의 SHA-256 기본값 573 → 576, Apple Pass Designer 566 → 567, 개구리와 두꺼비 584 → 587, 리눅스 커널 권고 576 → 579.

규칙을 증명하는 예외는 두 대형 상승자의 모양이다. 둘 다 36위와 41위에서 수백 포인트를 얻었는데, 이는 프론트페이지가 표시하지 않는 어딘가에서 그것을 쌓았다는 뜻이다. 795포인트와 댓글 630개를 가진 그 이야기—Mistral을 빼면 이 창에서 가장 많이 논의된 것—는 프론트페이지를 잠깐 들렀다가 떠났다. 한편 오늘 페이지의 정상에는 가중치 없는 모델 발표, 1987년산 데스크 램프, 플레이스홀더 도메인의 CSS 트랜지션이 있다. 순위는 감쇠 함수이고 포인트는 누적 함수이며, 그 사이의 격차는 이제 프론트페이지를 읽는 라운드업과 순위 목록을 읽는 라운드업이 서로 다른 날을 서술할 만큼 커졌다. 이 글은 순위 목록을 읽고 있다.

관통하는 흐름

첫째, 오픈 웨이트 프런티어가 배포 채널이 아니라 발표의 장르가 됐고, 오늘 그 두 선두주자가 나란히 그 장르를 출시했다. Mistral의 활성 파라미터 490억 개짜리 조 단위 파라미터 모델은 공개 프리뷰로 도착하고 가중치는 이달 말이다. Reflection의 5,010억 파라미터 Beam은 10,500개 GPU에서 1억 회의 RL 롤아웃과 함께 도착하고 가중치는 ’이달 말’이다. 페이지에서 완료된 유일한 오픈 웨이트 릴리스는 Aleph Alpha의 78B Kolibri이며, 아무도 그것이 프런티어 능력이라고 주장하지 않고, 독일어로, 규제 산업에서, 프로덕션에 쓰이는 바로 그것이다. 댓글들이 평결을 스스로 쓴다—가중치를 공개하든가 입을 닫든가—그리고 이것이 이제 표준적인 모양이라는 사실은 로딩 화면이, 결과물이 아니라, 벤치마킹되고 DeepSeek 표와 비교되며 164개 댓글로 논쟁되는 대상이라는 뜻이다. Mistral의 사전 출시 계획이 두 발표 중 진짜로 새로운 유일한 것이다. 잠금 해제되고 사이버에 특화된 조 단위 파라미터 모델을, 대중이 잠긴 것을 받기 전에 외부 기업과 국가 당국에 넘긴다. 그것은 위험한 능력을 배포하는 가장 책임 있는 방식이거나 그것을 유통하는 영구적 구조이고, 두 문서 중 어느 것도 어느 쪽인지 말하지 않는다.

둘째, 오늘 페이지는 검증에 대한 국민투표이고, 모든 표가 같은 방향으로 갔다. Dust는 큰 개체군에서—상당히 더 많은 연산을 뜻하며—경쟁력 있는 역전파 없는 사전학습과, 외삽으로 하나의 특정 베이스라인보다 10³에서 10⁴배 나은 효율을 주장하고, 스레드의 응답은 그래디언트가 엄격히 더 나은 신호이며 숫자는 투영으로 스케일한다는 것이다. Vals.ai의 Opus 5.5 에이전트는 반강자성 후보 두 개를 설계하고 계산을 공개했으며, 실제로 그 일을 해본 사람의 응답은 이론가들은 후보 물질을 끊임없이 만들어내고 합성이 어려운 부분이라는 것이다. Beam의 간판 일반화 데모는 몇 시간 안에 감사받고 약화된 형태로만 살아남는다. Polars는 벤더가 쓴 벤치마크에서 DuckDB와 DataFusion을 앞서고, TPC 전문가는 올바른 해석이 ’우리는 엔진에 작업했다’이지 ’우리가 더 빠르다’가 아니라고 설명한다. Gleam은 100개 모듈로 재작성을 벤치하고 벤치마크가 인위적이라고 미리 말한다. 후보, 증명, 벤치마크 표 또는 모델 릴리스의 생성 비용은 거의 0이 됐고, 검증된 결과 하나의 비용은 전혀 움직이지 않았다. 달라진 것은 페이지의 어느 때보다 많은 부분이 이론이라는 것이고, 이론은 세심하게 읽지 않으면 이제 형식상 결과와 구별되지 않는다. 오늘 페이지에서 이것을 정직하게 해결하는 유일한 항목은 Erdosproblems.com이다—우연히 벤치마크가 된 사이트로, 유지관리자가 지금 우선권 주장으로 제출된 설명 없는 AI 생성 해법의 홍수를 다루며 무엇을 해야 할지 묻고 있다. 그것이 나머지 123개 이야기가 풀지 못한 문제다.

셋째, 이 페이지에서 가장 작은 엔지니어링 결정들이 결과를 낳고, 그것이 2026년의 가장 일관된 특징이다. 플레이스홀더 도메인이 대역폭을 아끼려고 내용을 기본 페이지와 자바스크립트 파일로 나눴고, 그러면서 CI 파이프라인과 캡티브 포털 트리거, 그리고 한 사람의 안경 얼룩 확인 방법을 망가뜨렸다. 언어 컴파일러가 Erlang 소스를 내보내는 것에서 Erlang의 내부 표현을 내보내는 것으로 옮겨가고, 생태계의 앞으로의 모든 스택 트레이스가 올바른 줄을 가리킨다. 정육점의 주 검사 냉장고에서 나온 4°C 보정 오프셋이 페이지에서 가장 믿을 만한 하드웨어 리뷰를 만든다. ’서드파티 호환성’이라는 이름의 펌웨어 스위치가 모든 비공식 Tapo 통합을 로그에 아무것도 없이 403으로 만든다. 냉장고 센서와 알림 규칙 하나가 문이 한여름 절반 동안 숨기던 냉각 고장을 잡아낸다. 어느 것도 벤치마크나 파라미터 수와 함께 발표되지 않았고, 모두가 하중을 지탱한다. 오늘의 관통하는 흐름은 AI가 도래하거나 실패하고 있다는 것이 아니다. 프론트페이지의 발표 공급이 작동하는 것의 공급보다 커졌고, 작동하는 것들은 조용히 한 단계 아래, 램프에 관한 스레드 한가운데에 있다는 것이다.

2026년 10월 6일 발행. 점수는 13:05 PDT에 HN 파이어베이스 API에서 수집했다—프론트페이지 세트는 13:04, 전체 500개 톱스토리 순위 목록은 13:07—변동폭은 각 이야기를 다룬 가장 최근 라운드업에 인용된 점수 대비다. 오늘은 Algolia 스윕이 없다. 창 밖 점수는 순위 목록에서 가져왔다. 프론트페이지는 그 후에도 계속 움직인다.