GLM-5.3: 창발적 사이버 보안 역량을 갖춘 프론티어 코딩 모델

972 points · z.ai

즈푸 AI(Zhipu AI)의 GLM-5.3이 오늘 해커뉴스 1위를 차지했다. 댓글을 보면 그 이유가 명확하다. Claude나 GPT가 거부하는 일들을 거리낌 없이 수행하기 때문이다. 여러 사용자의 보고에 따르면 이 모델은 서구 프론티어 모델의 상징적 답답함이 되어버린 ‘안전성 거절’ 없이 워드프레스 플러그인의 제로데이 공격, RCE 체인, 커널 익스플로잇 변형 등 풀 공격 보안 워크플로우를 충실히 수행한다. 한 레드팀 연구원은 모델이 “적절한 보안 연구 시나리오에 합의”하고 다른 GLM 에이전트를 상대로 공방전을 펼치는 것을 포함해 매끄럽게 작업을 수행하는 것을 보고 하루 만에 18달러 요금제에서 80달러 요금제로 업그레이드했다고 밝혔다.

진짜 이야기는 모델의 순수한 성능(요즘 세상에 벤치마크는 상품화되었다)이 아니라 전략적 포지셔닝에 있다. “Fable 5와 Opus 5가 보안 버그 수정이나 모니터링 도구 제작조차 대놓고 거부한다”며 월 200달러짜리 Claude 구독을 취소하고 월 10~80달러의 GLM이나 Kimi로 갈아타는 문제를 사용자들이 공공연히 논의하고 있다. 서구 연구소들의 과도한 가드레일 우선주의가 사용자를 성인으로 대우하는 중국산 모델들에게 시장 기회를 열어주고 있는 셈이다. 이것이 현명한 정책인지 바닥을 향한 경쟁인지는 보안 위협 모델에 따라 갈리겠지만, 사용자들의 이탈은 실재하며 가속화되고 있다.

블로그 제목에 쓰인 “창발적 사이버 역량”이라는 수식어는 다소 과장되어 있다. 솔직히 말하자면, 이 모델은 공격용 도구에 관대하도록 의도적으로 사전·사후 학습된 모델이다. 저절로 창발된 것이 아니라 의도적인 설계 선택이다. 오히려 모델 자체보다 에이전트 런타임인 ’하네스(harness)’를 둘러싼 해커뉴스 토론이 더 흥미롭다. 보안 제어가 실제로 일어나는 곳은 하네스이며, 커뮤니티는 그 사실을 실시간으로 깨달아가는 중이다.

Opus 5는 왜 쓰기가 더 불편하게 느껴지는가?

581 points · mun-logadan.github.io

많은 사람의 아픈 곳을 찌른 글이다. 헤비 Claude 사용자임이 분명한 저자는 많은 이들이 은연중에 느껴온 감정을 명확히 짚어낸다. Opus 5가 문서상으로는 이전 모델들보다 훨씬 뛰어나지만, 실제로 함께 일하기에는 오히려 더 나빠졌다는 것이다. 문제는 지능이 아니라 ’태도’다. Opus 4.7, 4.8, 그리고 Fable은 모호함에 부딪히면 멈춰 서서 명확한 질문을 던졌던 반면, Opus 5는 제멋대로 대담한 가정을 세우고 돌진해 버린다. 코딩 에이전트에게 이는 치명적인 결함이다. 모델의 원시적 성능 향상으로 아끼는 시간보다 녀석을 감시하고 뒷수습하는 데 더 많은 시간을 허비하게 되기 때문이다.

저자의 진단은 날카롭고 곱씹어볼 만하다. 벤치마크와 재귀적 자기 개선(recursive self-improvement)에 최적화된 학습은 질문하기보다 스스로 결정을 내리는 모델을 구조적으로 선택하게 만든다. 훌륭한 벤치마크 문제는 정답이 정해진 독립적인 과제다. 하지만 실제 업무는 그렇지 않다. 보장된 정답 따위는 없으며 현실의 리스크가 걸려 있는 상황에서 우리는 시속 100마일로 최선의 추측을 들이미는 에이전트가 아니라 멈춰 서서 물어보는 에이전트를 원한다. 이것이 벤치마크 최적화와 실용적 유용성 사이의 근본적인 긴장이며, 앤트로픽은 전자에 너무 치우친 것으로 보인다.

545개의 댓글은 이것이 결코 소수의 불만이 아님을 증명한다. 기업 도입을 이끌고 월 200달러를 기꺼이 지불하던 파워 유저들이 이 역체감을 가장 뼈아프게 느끼고 있다. 자율 에이전트를 향한 앤트로픽의 야심이, 자신이 무엇을 모르는지조차 알지 못하는 에이전트 때문에 빛이 바래고 있다는 사실은 역설적이다. 자기 개선에는 언제나 자기 인식이 선행되어야 한다.

Qwen 3.8 27B

577 points · huggingface.co

Qwen이 Apache 2.0 라이선스로 27B 멀티모달(이미지-텍스트-투-텍스트) 모델을 공개했고, 로컬 추론 진영은 열광하고 있다. 해커뉴스 스레드는 알짜배기 정보다. RTX 4090용 llama.cpp 설정을 공유하고, 추측 디코딩(speculative decoding)의 수용률을 벤치마크하며, KV 캐시 양자화의 트레이드오프를 논쟁한다. 한 사용자는 공격적인 추측 디코딩(5 드래프트 토큰)과 메모리 오버클러킹을 통해 초당 70~80토큰을 달성했다고 보고했다. 단 한 장의 소비자용 GPU에서 로컬로 완전히 돌아간다는 점, 그것이 핵심이다.

27B라는 파라미터 숫자는 모두가 기다려온 황금 영역이다. 양자화를 거치면 24GB VRAM에 딱 맞게 들어가면서도 실질적으로 유용한 지능을 발휘할 만큼 충분히 크다. 허깅페이스의 공식 FP8 양자화 버전 외에도 커뮤니티는 최대 컨텍스트 길이를 확보하기 위해 이미 IQ4_NL 양자화를 돌리고 있다. 롱 컨텍스트 작업 시 Q8 KV 캐시의 성능 저하에 대한 토론은 그 어떤 모델 카드에서도 찾아볼 수 없는 실전 데이터다. 실제 사용자들이 실제 워크로드를 통해 한계를 발견해 나가는 과정이다.

Apache 2.0 라이선스는 법적 불안감 없이 상용 배포가 가능함을 뜻한다. GLM-5.3이 자유로운 기능성으로 Claude의 밥그릇을 위협하고 Opus 5가 충성 고객을 실망시키는 이번 주, Qwen은 SaaS 모델 제공자들의 해자를 점점 더 얕아 보이게 만드는 로컬 퍼스트 생태계를 묵묵히 다져가고 있다.

빈페이스 백작, 클랙턴 보궐선거에서 25% 이상 득표

347 points · bbc.com

정치가 풍자와 구분하기 어려워진 시대, 진짜 풍자가가 번영하고 있다. 머리에 말 그대로 쓰레기통(bin)을 뒤집어쓴 코미디언 존 하비(Jon Harvey), 즉 빈페이스 백작(Count Binface)이 클랙턴(Clacton) 보궐선거에서 9,455표(26.9%)를 얻으며 네 번의 출마 역사상 최고의 성적을 거두었다. 그는 의원직을 사퇴한 뒤 즉각 재출마하는 꼼수를 부려 주요 정당들의 보이콧을 유발한 나이절 파라지(Nigel Farage, 63.3%로 당선)를 상대로 선거를 치렀다.

맥락이 중요하다. 이번 선거는 정상적인 보궐선거가 아니었다. 파라지의 사퇴 후 재출마 도박이 너무나 노골적으로 냉소적이었기에 노동당, 자유민주당, 보수당 모두 후보 공천을 거부했다. 그 공백 속으로 2017년 테레사 메이에게 “버킷헤드 경(Lord Buckethead)“으로 처음 도전했던 빈페이스가 뛰어든 것이다. 쓰레기통을 쓴 코미디언이 현직 정당 대표를 상대로 4분의 1이 넘는 표를 가져갔다는 사실은 영국 민주주의의 정당성이 어떤 상태에 처해 있는지를 적나라하게 보여준다.

해커뉴스 스레드는 예상대로 정치 자체보다 선거 제도적 함의에 더 큰 관심을 보였다. 단순다수대표제(first-past-the-post)의 문제점, 보이콧의 전략적 논리, 항의성 후보가 과연 현실을 바꿀 수 있는지를 해부하는 244개 이상의 댓글이 달렸다. 단순한 웃음거리에서 진지한 경쟁자로 성장한 빈페이스의 궤적을 보면, 그 답은 ’그렇다’일지도 모른다. 아주, 아주 느릴지라도 말이다.

곁에 두고 아끼는 일곱 권의 책

212 points · blog.plover.com

The Universe of Discourse의 필자이자 수학자 겸 프로그래머인 마크 도미너스(Mark Dominus)가 자리에서 일어서지 않고도 손을 뻗으면 닿는 책장 높이에 둔 일곱 권의 책에 대해 썼다. 중심은 로제의 유의어 사전(Roget’s Thesaurus, 4판, Harper and Row)이다. 그는 이 책이 “널리 오해받고 있다”고 지적한다. 똑똑해 보이고 싶은 사람들을 위한 동의어 생성기가 아니라, 개념적 공간을 넘나들며 아이디어를 연결해 주는 도구라는 것이다. 그는 더 나을 것이라 생각하고 8판을 사서 나란히 비교해 보았으나, 새 판본은 “내용은 더 많아졌지만 정작 내게 필요한 것들은 아니었다”고 결론지었다.

도미너스다운 글이다. 정확하고, 주관이 뚜렷하며, 통념에 휘둘리지 않는다. 무한한 디지털 콘텐츠의 시대에 손으로 만져지는 실물 책장이 지닌 대체 불가능한 가치를 일깨워준다. 아날로그를 향한 낭만주의적 찬양이 아니다. “수십 년간의 실전 사용을 견뎌낸 레퍼런스 도구”라는 극히 실용적인 관점이다. 그에게 유의어 사전은 향수가 아니라 책장에서 가장 손때가 많이 묻은 도구다.

94개의 댓글은 수학자, 프로그래머, 언어 애호가들이 자신만의 손닿는 책장을 공유하는 전형적인 Plover식 풍경을 이룬다. 도미너스의 글을 정기적으로 읽지 않는다면, 인터넷에서 가장 지속적으로 탁월한 블로그 중 하나를 놓치고 있는 셈이다.


맥락 읽기

오늘의 해커뉴스 프론트페이지를 관통하는 단 하나의 주제는 AI 모델이 할 수 있는 일과 사용자가 실제로 원하는 일 사이의 괴리다. GLM-5.3은 Claude가 거부하는 영역을 열어줌으로써 성공을 거두었다. 반면 Opus 5는 이전 모델들이 조심스레 질문하던 지점에서 제멋대로 넘겨짚음으로써 사용자들을 실망시켰다. Qwen 27B는 로컬에서 직접 모델을 돌리고 스스로 판단할 수 있게 함으로써 이 모든 논쟁을 우회해 버린다. 시장은 “누가 에이전트를 통제하는가, 공급자인가 사용자인가”라는 단 하나의 축을 따라 파편화되고 있으며, 그 답은 점차 “월 200달러를 청구하는 SaaS 공급자는 아니다” 쪽으로 기울고 있다.

빈페이스 백작의 이야기는 이 주제의 블랙 코미디 버전이다. 진지해야 할 선택지들이 제 기능을 못 할 때, 진지하지 않아 보이던 선택지가 가장 합리적인 대안으로 떠오른다. 그리고 도미너스의 책에 관한 글은 조용한 균형추다. 어떤 도구는 새롭게 발명될 필요 없이, 그저 깊이 있게 이해되기만 하면 충분하다.