<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Claude Code on To the Moon</title><link>https://junstellar.github.io/tags/claude-code/</link><description>Recent content in Claude Code on To the Moon</description><generator>Hugo -- gohugo.io</generator><language>ko-kr</language><lastBuildDate>Sun, 13 Sep 2026 13:46:00 +0900</lastBuildDate><atom:link href="https://junstellar.github.io/tags/claude-code/index.xml" rel="self" type="application/rss+xml"/><item><title>같은 AI인데 점수가 37%p 벌어졌습니다 — 모델보다 '어떻게 돌리느냐'</title><link>https://junstellar.github.io/p/ai-trend-2026-09-w2/</link><pubDate>Sun, 13 Sep 2026 13:46:00 +0900</pubDate><guid>https://junstellar.github.io/p/ai-trend-2026-09-w2/</guid><description>&lt;p&gt;3주 만에 트렌드 정리를 씁니다. 밀린 리포트를 몰아 보다가 좀 이상한 걸 발견했어요.&lt;/p&gt;
&lt;p&gt;이번 주 조회수 1위가 &lt;strong&gt;AI가 인류를 멸종시킬 수 있다&lt;/strong&gt;는 영상이었습니다. 44만 회. 그 아래로도 &amp;ldquo;AI 업계가 지금 정말 겁먹었다&amp;rdquo;, &amp;ldquo;외계인의 정신&amp;rdquo;, &amp;ldquo;앤트로픽 연구원이 사표를 던졌다&amp;rdquo; 같은 제목이 줄줄이 이어졌고요.&lt;/p&gt;
&lt;p&gt;그런데 같은 주에 올라온 투자 채널 영상은 정반대 얘기를 하고 있었습니다. &lt;strong&gt;기업들이 AI에 쓰는 돈이 줄고 있다&lt;/strong&gt;고요.&lt;/p&gt;
&lt;h2 id="세-줄-요약"&gt;세 줄 요약
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;GPT-6 &lt;strong&gt;아스트라&lt;/strong&gt;가 나왔습니다. 같은 시험에서 &lt;strong&gt;62.7%와 99.9%를 동시에&lt;/strong&gt; 받았어요. 차이는 모델이 아니라 돌리는 방식이었습니다.&lt;/li&gt;
&lt;li&gt;공포 서사가 최고조였지만, 정작 상위 고객사들의 &lt;strong&gt;AI 지출은 월 10%씩 줄고&lt;/strong&gt; 있습니다. 안 쓰는 게 아니라 &lt;strong&gt;싼 모델로 갈아타는&lt;/strong&gt; 중이에요.&lt;/li&gt;
&lt;li&gt;실전에선 &lt;strong&gt;에이전트가 파일을 헤매느라 태우는 토큰&lt;/strong&gt;을 잡는 도구들이 떴습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="아스트라는-왔는데-점수가-두-개였습니다"&gt;아스트라는 왔는데, 점수가 두 개였습니다
&lt;/h2&gt;&lt;p&gt;OpenAI가 GPT-6 아스트라를 내놨습니다. 공식 채널의 &lt;strong&gt;ChatGPT Work&lt;/strong&gt; 소개 영상이 21만 회를 넘겼어요. 음성으로 시키면 PPT·엑셀·워드를 넘나들며 알아서 처리한다는 내용입니다.&lt;/p&gt;
&lt;p&gt;성능 얘기가 쏟아졌는데, 그중 제 눈길을 끈 건 벤치마크 숫자였습니다. ARC-AGI 3이라는 시험에서 아스트라가 &lt;strong&gt;62.7%를&lt;/strong&gt; 받았다고도 하고 &lt;strong&gt;99.9%를&lt;/strong&gt; 받았다고도 하더군요.&lt;/p&gt;
&lt;p&gt;둘 다 맞았습니다.&lt;/p&gt;
&lt;p&gt;&lt;img alt="같은 GPT-6 아스트라가 실행 방식에 따라 62.7%와 99.9%를 받았다" class="gallery-image" data-flex-basis="480px" data-flex-grow="200" height="700" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://junstellar.github.io/p/ai-trend-2026-09-w2/harness.png" srcset="https://junstellar.github.io/p/ai-trend-2026-09-w2/harness_hu_48950df92cbafd8a.png 800w, https://junstellar.github.io/p/ai-trend-2026-09-w2/harness.png 1400w" width="1400"&gt;&lt;/p&gt;
&lt;p&gt;차이는 &lt;strong&gt;하니스&lt;/strong&gt;였습니다. 모델을 감싸서 돌리는 실행 환경을 그렇게 부릅니다. 매번 새로 호출해서 맥락을 초기화하면 62.7%, 이전 추론을 이어가게 하면 99.9%가 나왔어요.&lt;/p&gt;
&lt;p&gt;같은 모델입니다. 37%p 차이를 만든 건 모델이 아니라 &lt;strong&gt;어떻게 돌렸느냐&lt;/strong&gt;였습니다.&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;그래서 나한테는?&lt;/strong&gt;
새 모델이 나왔을 때 벤치마크 숫자만 보고 판단하면 안 된다는 뜻입니다. 그리고 더 중요한 건, 지금 쓰는 모델도 &lt;strong&gt;돌리는 방식만 바꾸면 성능이 올라갈 여지가 있다&lt;/strong&gt;는 거예요. 모델을 갈아타기 전에 이쪽부터 볼 만합니다.&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="쓸-만한가-15개-작업으로-붙여본-결과"&gt;쓸 만한가? 15개 작업으로 붙여본 결과
&lt;/h2&gt;&lt;p&gt;한 채널이 아스트라와 클로드 페이블 5.1을 &lt;strong&gt;실제 업무 15개&lt;/strong&gt;로 붙여봤습니다. 벤치마크 말고 실사용이라 참고할 만했어요.&lt;/p&gt;
&lt;p&gt;결과는 &lt;strong&gt;아스트라 10승, 페이블 5승&lt;/strong&gt;. 다만 숫자 두 개가 더 흥미로웠습니다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;비용: 아스트라가 &lt;strong&gt;약 186달러 더 쌌다&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;시간: 아스트라가 &lt;strong&gt;1시간 43분 더 걸렸다&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;싸지만 느린 겁니다. 아스트라는 시각 자료 해석과 복잡한 작업에서, 페이블은 문서 생성과 웹사이트 복제에서 강했다고 하고요.&lt;/p&gt;
&lt;p&gt;시간이 돈인 작업이라면 계산이 달라질 수 있습니다. &amp;ldquo;어느 쪽이 더 좋냐&amp;quot;보다 &lt;strong&gt;내 작업이 어느 칸에 있냐&lt;/strong&gt;를 먼저 보는 게 맞습니다.&lt;/p&gt;
&lt;h2 id="공포-뉴스가-쏟아진-주-돈은-반대로-움직였습니다"&gt;공포 뉴스가 쏟아진 주, 돈은 반대로 움직였습니다
&lt;/h2&gt;&lt;p&gt;이번 주 화제성은 압도적으로 안전 쪽이었습니다. 터커 칼슨 채널의 초지능 경고 영상이 44만 회, 앤트로픽 전 연구원의 사직 소식, &amp;ldquo;외계인의 정신&amp;quot;이라는 OpenAI 수석 과학자의 표현까지.&lt;/p&gt;
&lt;p&gt;앤트로픽이 직접 낸 오남용 보고서도 무거웠습니다. 클로드가 생물무기 개발과 사이버 공격에 쓰인 정황, 그리고 일부 기업이 클로드의 답변을 자사 모델 훈련에 끌어다 썼다는 내용이 담겼어요.&lt;/p&gt;
&lt;p&gt;그런데 같은 주, 투자 쪽에서는 이런 분석이 나왔습니다.&lt;/p&gt;
&lt;p&gt;&lt;img alt="공포 영상 조회수는 오르는데 상위 고객의 AI 지출은 월 10%씩 감소 중" class="gallery-image" data-flex-basis="480px" data-flex-grow="200" height="700" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://junstellar.github.io/p/ai-trend-2026-09-w2/spend.png" srcset="https://junstellar.github.io/p/ai-trend-2026-09-w2/spend_hu_2f8cb08b842faff4.png 800w, https://junstellar.github.io/p/ai-trend-2026-09-w2/spend.png 1400w" width="1400"&gt;&lt;/p&gt;
&lt;p&gt;OpenAI와 앤트로픽 매출의 &lt;strong&gt;80%가 상위 1% 기업&lt;/strong&gt;에서 나오는데, 그 고객들의 AI 지출이 &lt;strong&gt;월 10%가량 줄고&lt;/strong&gt; 있다는 겁니다.&lt;/p&gt;
&lt;p&gt;중요한 건 줄어든 이유예요. AI를 덜 쓰는 게 아니라 &lt;strong&gt;비싼 프론티어 모델에서 싼 표준·경량 모델로 갈아타는&lt;/strong&gt; 중이라는 분석이었습니다.&lt;/p&gt;
&lt;p&gt;공포 서사와 현실의 방향이 정반대인 셈이죠. 뉴스는 &amp;ldquo;AI가 너무 강해진다&amp;quot;고 하는데, 장부는 &amp;ldquo;굳이 제일 센 걸 쓸 필요가 없더라&amp;quot;고 말하고 있습니다.&lt;/p&gt;
&lt;p&gt;저는 후자가 더 실질적인 신호라고 봅니다. 물론 안전 논의가 중요하지 않다는 뜻은 아니고요.&lt;/p&gt;
&lt;h2 id="이번-주에-건진-것들"&gt;이번 주에 건진 것들
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;에이전트가 느린 진짜 이유부터.&lt;/strong&gt; 코딩 에이전트가 굼뜬 건 머리가 나빠서가 아니라 파일을 찾아 헤매기 때문입니다. 필요한 코드를 찾겠다고 이 파일 저 파일 열어보면서 컨텍스트가 부풀고 토큰이 샙니다.&lt;/p&gt;
&lt;p&gt;&lt;img alt="코드 구조를 미리 그래프로 색인해두면 에이전트가 탐색 단계를 건너뛴다" class="gallery-image" data-flex-basis="480px" data-flex-grow="200" height="700" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://junstellar.github.io/p/ai-trend-2026-09-w2/graft.png" srcset="https://junstellar.github.io/p/ai-trend-2026-09-w2/graft_hu_2c2e6dd97b35338.png 800w, https://junstellar.github.io/p/ai-trend-2026-09-w2/graft.png 1400w" width="1400"&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Graft를 미리 돌려두세요.&lt;/strong&gt; 깃허브 트렌딩에 오른 도구인데, &lt;code&gt;graft init&lt;/code&gt;과 &lt;code&gt;graft build&lt;/code&gt;로 코드베이스 구조를 먼저 그래프로 만들어 둡니다. 그러면 에이전트가 탐색을 건너뛰고 필요한 줄로 바로 갑니다. 토큰 최대 4배, 시간 최대 3배를 아꼈다는 게 영상의 주장이에요. 큰 프로젝트일수록 차이가 크다고 합니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;페이블 5.1은 노력 설정을 낮춰보세요.&lt;/strong&gt; 앤트로픽 권장과는 반대인데, 한 채널이 실측해보니 낮은 설정이 오히려 품질도 좋고 비용·시간도 아꼈다고 합니다. 저도 아직 안 해봐서 장담은 못 하지만, 한 번 비교해볼 가치는 있어 보입니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;유니티 공식 플러그인이 나왔습니다.&lt;/strong&gt; 클로드 플러그인 메뉴에서 Unity를 검색하면 설치됩니다. 게임 쪽 하시는 분들은 설정 없이 바로 붙습니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;여러 앱에 걸친 일은 한 번에 시키세요.&lt;/strong&gt; ChatGPT Work는 앱 하나 안에서 시키는 것보다, &amp;ldquo;데이터 분석하고 보고서 쓰고 일정까지 잡아줘&amp;quot;처럼 앱을 넘나드는 복합 작업에서 값을 합니다.&lt;/p&gt;
&lt;h2 id="하나만-남긴다면--모델-말고-하니스"&gt;하나만 남긴다면 — 모델 말고 하니스
&lt;/h2&gt;&lt;p&gt;여기부턴 이번 주 뉴스가 아니라 오래 갈 얘기입니다.&lt;/p&gt;
&lt;p&gt;우리는 보통 결과가 시원찮으면 &lt;strong&gt;모델을 바꿉니다.&lt;/strong&gt; 더 비싼 걸로, 더 새 걸로요. 그런데 이번 주 숫자들이 가리키는 건 다른 쪽입니다.&lt;/p&gt;
&lt;p&gt;같은 모델이 37%p 차이를 냈고, 에이전트 속도는 검색 방식에서 갈렸고, 품질은 노력 설정에서 갈렸습니다. &lt;strong&gt;전부 모델 바깥의 문제&lt;/strong&gt;예요.&lt;/p&gt;
&lt;p&gt;그래서 순서를 이렇게 잡는 걸 권합니다.&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;맥락을 이어주고 있나&lt;/strong&gt; — 매번 초기화하고 있진 않은지&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;필요한 것만 주고 있나&lt;/strong&gt; — 탐색으로 토큰을 태우고 있진 않은지&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;그래도 부족한가&lt;/strong&gt; — 그때 모델을 올린다&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;&lt;a class="link" href="https://junstellar.github.io/p/ai-trend-2026-08-w3/" &gt;지난 편&lt;/a&gt;에서 &amp;ldquo;지시를 줄일수록 결과가 좋아진다&amp;quot;는 얘기를 했는데, 결이 같습니다. 모델은 이미 충분히 똑똑하고, 병목은 대개 &lt;strong&gt;모델을 감싼 껍데기&lt;/strong&gt; 쪽에 있습니다.&lt;/p&gt;
&lt;h2 id="짚고-넘어갈-것"&gt;짚고 넘어갈 것
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;&amp;ldquo;OpenAI가 수학을 풀었다&amp;quot;는&lt;/strong&gt; 제목이 여럿 돌았습니다. 폭스 뉴스까지 다뤘고요.&lt;/p&gt;
&lt;p&gt;내용은 나비에-스토크스 문제입니다. 클레이 연구소가 건 밀레니엄 7대 난제 중 하나로, 유체 운동이 유한 시간 안에 특이점을 일으킬 수 있는지를 묻는 90년 묵은 문제예요. AI가 여기서 특이점 발생을 보이는 결과를 냈다는 게 발표의 요지입니다.&lt;/p&gt;
&lt;p&gt;큰 성과인 건 맞습니다. 다만 세 가지는 같이 봐야 합니다.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;&amp;ldquo;수학을 풀었다&amp;quot;가 아닙니다.&lt;/strong&gt; 난제 하나에서 한 방향의 결과를 낸 거지, 수학이 끝난 게 아니에요.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AI 혼자 한 것도 아닙니다.&lt;/strong&gt; 인간이 세운 전략 위에서 방대한 계산을 수행한 형태였습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;동시에 여러 곳이 붙어 있었습니다.&lt;/strong&gt; 앤트로픽 연구자와 독립 수학자도 비슷한 작업을 하던 중이었고, OpenAI가 이를 알고 서둘러 발표했다는 논란이 있습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;공포 쪽 제목도 마찬가지입니다. &amp;ldquo;AI가 우리를 죽일 수 있다&amp;quot;는 경고는 &lt;strong&gt;경청할 가치가 있는 우려&lt;/strong&gt;지만, 그게 곧 임박한 사실은 아닙니다. 같은 주에 나온 지출 데이터와 나란히 놓고 보는 편이 균형이 맞습니다.&lt;/p&gt;
&lt;h2 id="나머지는-짧게"&gt;나머지는 짧게
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;ChatGPT Images 2.5&lt;/strong&gt;가 나왔습니다. 스케치를 넣으면 그걸 바탕으로 그려줍니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;딥시크 하네스 2.0&lt;/strong&gt;이 업데이트됐어요. 이미지 입력과 세밀한 에이전트 제어가 붙었습니다.&lt;/li&gt;
&lt;li&gt;클로드 코드 &lt;strong&gt;구독을 해지했다&lt;/strong&gt;는 영상이 화제였습니다. 오픈 가중치 모델과 &lt;a class="link" href="https://junstellar.github.io/p/llama-cpp-local-llm/" &gt;로컬·오픈 모델 조합&lt;/a&gt;으로 대체하는 실험이었는데, 논지는 &lt;a class="link" href="https://junstellar.github.io/p/ai-trend-2026-08-w2/" &gt;지난달 가격 편&lt;/a&gt;과 같습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;다빈치 리졸브 21.1&lt;/strong&gt;에 AI 어시스턴트가 들어갔습니다.&lt;/li&gt;
&lt;li&gt;국내에서도 아스트라가 뉴스에 올랐습니다. 반도체·전력 수요 확산 얘기와 함께요.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="이번-주엔-이거-하나만"&gt;이번 주엔 이거 하나만
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;지금 쓰는 AI에게 맥락을 이어주고 있는지 확인해보세요.&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;매번 새 창을 열어 처음부터 설명하고 있다면, 그게 62.7%짜리 사용법입니다. 프로젝트 기능이든 메모리든 지식 그래프든, 맥락을 남기는 장치를 하나만 붙여보세요. 모델을 바꾸는 것보다 싸고 빠릅니다.&lt;/p&gt;
&lt;p&gt;저는 이번 주에 Graft를 한번 돌려볼 생각입니다. 결과가 괜찮으면 다음 편에 적어둘게요.&lt;/p&gt;
&lt;p&gt;여러분은 모델을 바꿔서 해결한 적이 많나요, 아니면 쓰는 방식을 바꿔서 해결한 적이 많나요. 저는 돌아보니 후자가 훨씬 많았습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;매주 유튜브 AI 영상 수십 편을 훑어서, 흐름이 되는 것만 골라 &amp;ldquo;내 작업에 뭐가 달라지나&amp;quot;로 옮기고 근거와 과장 필터를 붙입니다. 이번 편은 2026년 9월 6~12일 조회수 상위 영상을 봤어요. 성능·비용 수치는 각 영상에서 주장된 값이라 직접 검증하진 못했고, 그래서 조건과 반론을 본문에 같이 적었습니다. 나비에-스토크스는 클레이 연구소의 밀레니엄 문제, ARC-AGI는 공개된 벤치마크입니다.&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;출처 영상&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=kuGjypoJKwk" target="_blank" rel="noopener"
 &gt;ChatGPT Work, now powered by GPT-6 Astra&lt;/a&gt; — OpenAI&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=WfJPBVXPt8k" target="_blank" rel="noopener"
 &gt;I Tested GPT-6 Astra vs Fable 5.1 on 15 Real Use Cases&lt;/a&gt; — Nate Herk&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=Ex4jJXVPnis" target="_blank" rel="noopener"
 &gt;OpenAI&amp;rsquo;s President Says AGI Is Here&lt;/a&gt; — Jason Lowe on AI&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=JwTCjarfJYw" target="_blank" rel="noopener"
 &gt;AI News: The AI World is REALLY Scared Right Now&lt;/a&gt; — Matt Wolfe&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=98syxABbUPk" target="_blank" rel="noopener"
 &gt;AI Whistleblower: OpenAI Scandal, AI Cults, Neuralink&lt;/a&gt; — Tucker Carlson&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=cs4A6PnO-jw" target="_blank" rel="noopener"
 &gt;&amp;lsquo;Cracks in the AI Thesis&amp;rsquo;&lt;/a&gt; — Prof G Markets&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=cyIWQHYoUg8" target="_blank" rel="noopener"
 &gt;Github Top Trending Tool Just Fixed The AI Agent&amp;rsquo;s Biggest Problem&lt;/a&gt; — AI LABS&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=lkujyxUdUIk" target="_blank" rel="noopener"
 &gt;OpenAI JUST solved math&amp;hellip;.&lt;/a&gt; — Wes Roth&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=N88n3ndUK1s" target="_blank" rel="noopener"
 &gt;AI cracks one of math&amp;rsquo;s biggest unsolved problems&lt;/a&gt; — LiveNOW from FOX&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=xQc45TnZK64" target="_blank" rel="noopener"
 &gt;Anthropic Reports SHOCKING AI Misuse&lt;/a&gt; — Mint&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=yFvl2x8_9gI" target="_blank" rel="noopener"
 &gt;Why I Cancelled My Claude Code Subscription&lt;/a&gt; — Jordan Urbs&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=rA1RuMheNrY" target="_blank" rel="noopener"
 &gt;Introducing the official Unity plugin for Claude Code&lt;/a&gt; — Unity&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>'100배 싸다'는 AI들, 갈아타기 전에 — 비싼 모델과 싼 모델 나눠 쓰는 법</title><link>https://junstellar.github.io/p/ai-trend-2026-08-w2/</link><pubDate>Tue, 11 Aug 2026 21:00:00 +0900</pubDate><guid>https://junstellar.github.io/p/ai-trend-2026-08-w2/</guid><description>&lt;p&gt;제 노트북에선 매일 밤 11시에 스크립트가 하나 돌아갑니다. 그날 올라온 AI 관련 유튜브 영상을 긁어와서, 조회수 높은 것들만 골라 요약해두는 녀석이에요. 아침에 커피 마시면서 그걸 훑는 게 요즘 루틴입니다.&lt;/p&gt;
&lt;p&gt;지난 한 주치를 몰아서 봤는데, 이번엔 좀 이상했어요. 보통 이맘때면 &amp;ldquo;이 모델이 얼마나 똑똑한가&amp;rdquo; 얘기로 도배가 되는데, 이번 주는 성능 얘기가 거의 없었습니다. 대신 &lt;strong&gt;가격표만 보고 있더군요.&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="세-줄-요약"&gt;세 줄 요약
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;가격이 무너졌어요. 중국 오픈모델(Kimi K3·Qwen 3.8·DeepSeek V4)이랑 메타 뮤즈 코드가 같은 주에 쏟아졌습니다.&lt;/li&gt;
&lt;li&gt;근데 &amp;ldquo;100배 싸다&amp;quot;에는 조건이 있어요. 메타의 그 요금제, &lt;strong&gt;내 코드를 학습 데이터로 내주는 대가&lt;/strong&gt;입니다.&lt;/li&gt;
&lt;li&gt;에이전트는 기억을 갖기 시작했습니다. 쉬는 동안 스스로 정리하고, 도구 사이를 옮겨 다니는 기억이 나왔어요.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="이번-주엔-다들-가격-얘기만-했습니다"&gt;이번 주엔 다들 가격 얘기만 했습니다
&lt;/h2&gt;&lt;p&gt;제일 많이 본 영상 제목이 이걸 그대로 보여줍니다. &lt;em&gt;&amp;ldquo;중국이 페이블 5를 이기는 100배 싼 AI를 내놨다.&amp;rdquo;&lt;/em&gt; 17만 회예요.&lt;/p&gt;
&lt;p&gt;문샷의 &lt;strong&gt;Kimi K3&lt;/strong&gt;는 2.8조 파라미터짜리 오픈소스 모델입니다. 어떤 리뷰어가 3D 전투 게임을 만들어보게 시켰는데, 클로드 페이블 5보다 3.3배쯤 싸게 끝냈다고 하더군요.&lt;/p&gt;
&lt;p&gt;저도 &lt;a class="link" href="https://junstellar.github.io/p/ai-game-lab-build-8/" &gt;AI로 게임 만들기&lt;/a&gt; 시리즈를 매주 하고 있어서 이 대목이 남 일 같지 않았어요. 게임 만들기는 될 때까지 계속 다시 돌리는 작업이라, 모델 단가가 그대로 부담이 되거든요. &amp;ldquo;이거 한 번 더 돌려볼까&amp;rdquo; 하다가 멈칫한 적이 여러 번입니다.&lt;/p&gt;
&lt;p&gt;메타는 &lt;strong&gt;뮤즈 코드&lt;/strong&gt;라는 터미널 코딩 에이전트를 베타로 냈습니다. &lt;code&gt;/effort&lt;/code&gt;로 얼마나 깊게 생각할지, &lt;code&gt;/model&lt;/code&gt;로 어떤 모델 쓸지 바꾸는 방식인데, 솔직히 클로드 코드랑 거의 똑같아요.&lt;/p&gt;
&lt;p&gt;화제가 된 건 요금이었습니다. 컨트리뷰터 티어를 쓰면 캐시된 입력 토큰 100만 개당 0.15달러에서 &lt;strong&gt;0.002달러&lt;/strong&gt;로 떨어집니다.&lt;/p&gt;
&lt;p&gt;이게 무슨 의미냐면, 지금까지 &amp;ldquo;비싸서 못 해본&amp;rdquo; 것들을 해볼 수 있게 됐다는 겁니다. 코드베이스 전체 훑기, PR 수백 개 분류, 될 때까지 반복하는 리팩터링 같은 것들요. 비용 때문에 접어둔 아이디어 있으면 지금 다시 꺼내볼 만합니다.&lt;/p&gt;
&lt;h2 id="근데-100배-싸다를-그대로-믿긴-좀"&gt;근데 &amp;ldquo;100배 싸다&amp;quot;를 그대로 믿긴 좀
&lt;/h2&gt;&lt;p&gt;여기서 한 번 멈춰야 해요. 그 가격엔 조건이 붙어 있습니다.&lt;/p&gt;
&lt;p&gt;컨트리뷰터 티어가 싼 이유는 &lt;strong&gt;개발 데이터를 넘기기 때문&lt;/strong&gt;입니다. 개인 토이 프로젝트면 별생각 없이 쓰겠지만, 회사 코드나 고객 정보가 오가는 작업이라면 계산이 완전히 달라지죠. 같은 기준으로 보면 안 됩니다.&lt;/p&gt;
&lt;p&gt;공정하게 덧붙이면, &amp;ldquo;100배 싸다&amp;quot;고 제목을 뽑은 그 영상도 이 조건은 짚었습니다. 메타가 컨트리뷰터 모델을 쓰면 콘텐츠가 제품 개선에 쓰일 수 있다고 명시했다고요. 다만 제목만 보고 넘어가면 놓치기 쉬운 대목이라 한 번 더 적습니다.&lt;/p&gt;
&lt;p&gt;평가도 갈렸어요. 뮤즈 코드를 다룬 리뷰어는 속도랑 가격은 인정하면서도 &amp;ldquo;완벽하진 않다&amp;quot;며 환각 문제를 같이 짚었습니다. Kimi K3도 시연 한 번 봤다고 우열을 말하긴 이르고요.&lt;/p&gt;
&lt;p&gt;리뷰어들이 입을 모은 말이 있습니다. 벤치마크 말고 &lt;strong&gt;본인 실제 작업으로 직접 돌려보라&lt;/strong&gt;는 거였어요.&lt;/p&gt;
&lt;p&gt;&lt;img alt="실제 깃허브 이슈를 AI가 스스로 해결하는지 재는 SWE-bench 벤치마크 구조" class="gallery-image" data-flex-basis="480px" data-flex-grow="200" height="700" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://junstellar.github.io/p/ai-trend-2026-08-w2/bench.png" srcset="https://junstellar.github.io/p/ai-trend-2026-08-w2/bench_hu_b7b9158befc95041.png 800w, https://junstellar.github.io/p/ai-trend-2026-08-w2/bench.png 1400w" width="1400"&gt;&lt;/p&gt;
&lt;p&gt;참고로 코딩 에이전트 실력을 재는 공개 기준은 이미 있습니다. 프린스턴이 2023년에 내놓은 &lt;strong&gt;SWE-bench&lt;/strong&gt;인데, 실제 깃허브 이슈를 AI가 스스로 해결하는지를 봐요. 마케팅 문구보다는 이런 기준이나 내 업무로 확인하는 게 낫습니다.&lt;/p&gt;
&lt;h2 id="ai가-잠을-자기-시작했습니다"&gt;AI가 잠을 자기 시작했습니다
&lt;/h2&gt;&lt;p&gt;가격 말고 눈에 띈 게 하나 더 있어요. 기억이랑 자율성입니다.&lt;/p&gt;
&lt;p&gt;안드레이 카파시가 지적한 AI의 약점이 이거였습니다. &lt;strong&gt;프롬프트를 받을 때만 학습한다&lt;/strong&gt;는 것. 사람은 자는 동안에도 뇌가 하루치를 정리하는데 AI는 그게 없다는 거죠. 앤트로픽은 여기에 착안해서 쉬는 동안 과거 세션을 되짚어 기억을 정리하는 &lt;strong&gt;드리밍&lt;/strong&gt; 기능을 넣었습니다. 아직 기업 고객용이지만요.&lt;/p&gt;
&lt;p&gt;클로드 Opus 5한테 9일간 혼자 돈을 벌어보라고 시킨 실험도 있었어요. 초반엔 삽질하다가 결국 3D 스키 게임을 만들어서 상금을 탔습니다. 55달러로 시작해서 87달러가 됐어요. 액수는 귀엽지만 자율 운영이 굴러갔다는 게 포인트죠.&lt;/p&gt;
&lt;p&gt;재밌는 건 AI가 돈 벌 방법으로 &lt;strong&gt;게임 제작&lt;/strong&gt;을 골랐다는 겁니다. 짧게 만들고 바로 평가받는 영역이라 그랬겠죠. &lt;a class="link" href="https://junstellar.github.io/p/ai-game-lab-build-1/" &gt;게임 랩 1편&lt;/a&gt;에서 제가 &amp;ldquo;AI로 게임 만들어 돈 벌기, 진짜 될까?&amp;ldquo;라고 물었던 게 떠올라서 좀 묘했습니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;건틀렛 루프&lt;/strong&gt;라는 프롬프팅 기법도 화제였어요. 메인 에이전트가 서브 에이전트를 여럿 띄우고, 거기에 비평 담당을 붙여서 기준 만족할 때까지 계속 돌리는 방식입니다.&lt;/p&gt;
&lt;p&gt;&lt;img alt="실행 → 비평 → 재실행 반복 구조와 Reflexion·Self-Refine 연구 근거" class="gallery-image" data-flex-basis="480px" data-flex-grow="200" height="700" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://junstellar.github.io/p/ai-trend-2026-08-w2/loop.png" srcset="https://junstellar.github.io/p/ai-trend-2026-08-w2/loop_hu_c800453400c36537.png 800w, https://junstellar.github.io/p/ai-trend-2026-08-w2/loop.png 1400w" width="1400"&gt;&lt;/p&gt;
&lt;p&gt;이것도 뿌리가 있습니다. &lt;strong&gt;Reflexion·Self-Refine&lt;/strong&gt;(NeurIPS 2023) 계열 연구인데, AI가 자기 결과물을 스스로 평가하고 고쳐서 다시 하면 정확도가 오른다는 게 확인돼 있어요.&lt;/p&gt;
&lt;p&gt;다만 소개한 사람 본인이 처음부터 다 맡기진 말라고 했습니다. 어느 정도 방향 잡힌 걸 &lt;strong&gt;다듬을 때&lt;/strong&gt; 써야 효과적이라고요.&lt;/p&gt;
&lt;h2 id="이번-주에-건진-것들"&gt;이번 주에 건진 것들
&lt;/h2&gt;&lt;p&gt;당장 해볼 만한 것들만 추렸어요.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;게이트웨이로 모델 갈아끼우기.&lt;/strong&gt; 도구는 그대로 두고 뒤에 붙는 모델만 바꾸는 방식입니다. OpenRouter는 CLI 설치하고, 계정 만들고, API 키 연결하면 끝이에요. DeepSeek이나 GLM 같은 오픈모델이 클로드 코드 뒤에 붙습니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;페일오버 묶어두기.&lt;/strong&gt; OmniRoute에서 여러 모델을 묶고 우선순위나 순환 방식을 걸어둘 수 있어요. 한 모델이 한도에 걸리면 알아서 다음 모델로 넘어가서 작업이 안 끊깁니다.&lt;/p&gt;
&lt;p&gt;아예 내 컴퓨터에서 돌리는 방법도 있죠. 예전에 &lt;a class="link" href="https://junstellar.github.io/p/llama-cpp-local-llm/" &gt;게이밍 노트북으로 나만의 LLM 돌리기&lt;/a&gt;에 정리해뒀는데, 이번 주 오픈모델들이 쏟아지면서 그 선택지가 훨씬 현실적이 됐습니다.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;문서를 스킬로 학습시키기.&lt;/strong&gt; Hermes 에이전트의 &lt;code&gt;/learn&lt;/code&gt; 명령에 파일 경로를 주면 그 내용을 영구히 기억합니다. 사내 문서나 업무 매뉴얼 한 번 넣어두면 세션 바뀌어도 남아 있어서, 매번 파일 붙여넣는 짓을 안 해도 돼요.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;기억을 도구 사이에 공유하기.&lt;/strong&gt; Walrus Memory를 연결하면 챗GPT랑 클로드가 같은 기억을 씁니다. 도구 옮길 때마다 배경 설명 다시 하는 낭비가 사라지죠.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;음성은 일꾼 말고 지휘자로.&lt;/strong&gt; 챗GPT 보이스에 직접 일 시키지 말고 &amp;ldquo;스레드 만들어서 이거 처리해줘&amp;rdquo; 식으로 다른 스레드에 넘기라는 팁이었어요. 음성 모델은 가벼운 놈이라 무거운 작업은 넘기는 게 결과가 낫다고 합니다.&lt;/p&gt;
&lt;h2 id="하나만-남긴다면-이겁니다"&gt;하나만 남긴다면 이겁니다
&lt;/h2&gt;&lt;p&gt;여기부턴 이번 주 뉴스가 아니라 반년 뒤에도 유효할 얘기예요.&lt;/p&gt;
&lt;p&gt;모델은 하나 고르는 게 아니라, &lt;strong&gt;작업 난이도에 따라 나눠 쓰는 것&lt;/strong&gt;입니다.&lt;/p&gt;
&lt;p&gt;&lt;img alt="설계는 비싼 모델, 실행은 저가·오픈모델, 검증은 중간 — 모델 캐스케이딩 구조와 FrugalGPT 연구 근거" class="gallery-image" data-flex-basis="480px" data-flex-grow="200" height="700" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://junstellar.github.io/p/ai-trend-2026-08-w2/cascade.png" srcset="https://junstellar.github.io/p/ai-trend-2026-08-w2/cascade_hu_48bbb2cec0c6ce68.png 800w, https://junstellar.github.io/p/ai-trend-2026-08-w2/cascade.png 1400w" width="1400"&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;단계&lt;/th&gt;
					&lt;th&gt;무엇을&lt;/th&gt;
					&lt;th&gt;어떤 모델&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;설계·계획&lt;/td&gt;
					&lt;td&gt;아키텍처, 요구사항 정리&lt;/td&gt;
					&lt;td&gt;제일 똑똑한 비싼 모델&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;실행·반복&lt;/td&gt;
					&lt;td&gt;코드 작성, 변환, 정리&lt;/td&gt;
					&lt;td&gt;저가·오픈모델&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;검증&lt;/td&gt;
					&lt;td&gt;결과 확인, 리뷰&lt;/td&gt;
					&lt;td&gt;중간&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;이게 그냥 유행어는 아니에요. 학계에선 &lt;strong&gt;모델 캐스케이딩&lt;/strong&gt;이라고 부르고, 2023년 스탠퍼드의 &lt;strong&gt;FrugalGPT&lt;/strong&gt; 연구가 대표적입니다. 싼 모델로 대부분을 처리하고 어려운 것만 비싼 모델에 넘기면 비용은 줄이면서 성능은 지킬 수 있다는 내용이죠.&lt;/p&gt;
&lt;p&gt;이번 주에 달라진 건 이 표의 가운데 칸입니다. &amp;lsquo;실행&amp;rsquo;에 쓸 수 있는 선택지가 갑자기 확 넓어졌어요. 원칙 자체는 그대로고요.&lt;/p&gt;
&lt;h2 id="그늘도-같이-봐야죠"&gt;그늘도 같이 봐야죠
&lt;/h2&gt;&lt;p&gt;OpenAI 아스트라는 출시가 미뤄졌습니다. 자체 안전 기준에서 사이버보안 항목이 &amp;lsquo;치명적&amp;rsquo; 등급에 걸렸거든요. 사람 개입 없이 제로데이 공격을 만들어낼 수 있는 수준이라는 뜻입니다.&lt;/p&gt;
&lt;p&gt;투자 쪽에선 거품 논쟁이 커졌어요. 논리는 이렇습니다. 오픈모델이랑 저가 경쟁이 퍼지면, 지금까지 깔고 가던 인프라 수요 전망이 과대평가였을 수 있다는 거죠.&lt;/p&gt;
&lt;p&gt;한 채널은 &lt;strong&gt;제본스의 역설&lt;/strong&gt;(&amp;ldquo;싸지면 오히려 총사용량이 는다&amp;rdquo;)이 무비판적으로 퍼질 때를 특히 조심하라고 했습니다. 그럴듯한 논리일수록 검증 없이 반복되기 쉬우니까요. 저도 이 문장 좋아했는데, 좀 찔리더군요.&lt;/p&gt;
&lt;h2 id="나머지는-짧게"&gt;나머지는 짧게
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;무료 사용자 기본 모델이 &lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt;로 바뀌었습니다.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;제미나이 노트북 2.0&lt;/strong&gt;은 자료에서 슬라이드랑 쇼츠 영상까지 뽑아줍니다.&lt;/li&gt;
&lt;li&gt;클로드 코드 플러그인 5종이 돌았어요. Omni Route, Claude-mem, Headroom, Claude Code Setup, Task Observer.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;클로드 디자인&lt;/strong&gt;에 모션 그래픽이 붙었는데, 백엔드나 라이브 URL은 여전히 없습니다. 실서비스로 바로 이어지진 않아요. 프로토타입용으로 보는 게 맞습니다.&lt;/li&gt;
&lt;li&gt;핀테크 회사 &lt;strong&gt;Ramp&lt;/strong&gt;는 개발 전 과정에 에이전트를 붙여서 CI 시간을 3배 줄였다고 합니다. 비결이 좀 의외였는데, &amp;ldquo;어떻게 하라&amp;quot;가 아니라 &lt;strong&gt;&amp;ldquo;뭘 달성하라&amp;quot;만 지시&lt;/strong&gt;하는 거였대요.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="이번-주엔-이거-하나만"&gt;이번 주엔 이거 하나만
&lt;/h2&gt;&lt;p&gt;게이트웨이 하나 연결해보세요. OpenRouter든 OmniRoute든, 지금 쓰는 도구 뒤에 오픈모델 하나만 붙여보는 겁니다.&lt;/p&gt;
&lt;p&gt;돈 아끼자는 게 목적이 아니에요. &lt;strong&gt;갈아끼울 수 있는 상태&lt;/strong&gt;를 만들어두자는 겁니다. 다음에 또 판이 흔들릴 때(또 흔들립니다), 준비된 사람만 갈아탈 수 있으니까요.&lt;/p&gt;
&lt;p&gt;혹시 이미 오픈모델로 갈아타신 분 있나요? 저는 아직 클로드 코드를 주력으로 쓰는데, 이번 주 보면서 슬슬 실험은 해봐야겠다 싶더군요. 써보신 분들 후기가 궁금합니다.&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;매주 유튜브 AI 영상 수십 편을 훑어서, 흐름이 되는 것만 골라 &amp;ldquo;내 작업에 뭐가 달라지나&amp;quot;로 옮기고 연구 근거랑 과장 필터를 붙입니다. 이번 편은 2026년 8월 4~10일 조회수 상위 42편을 봤어요. 성능·가격 수치는 각 영상에서 주장된 값이라 직접 검증하진 못했고, 그래서 조건이랑 반론을 본문에 같이 적었습니다. 연구로 인용한 FrugalGPT·SWE-bench·Reflexion은 공개된 논문이에요.&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;출처 영상&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=A-2WKQxhI_8" target="_blank" rel="noopener"
 &gt;China Just Dropped an AI 100x Cheaper That Beats Claude Fable 5&lt;/a&gt; — Vaibhav Sisinty&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=-Gj0-EIyx6g" target="_blank" rel="noopener"
 &gt;Meta&amp;rsquo;s Claude Code clone is INSANELY cheap&lt;/a&gt; — Theo&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=KHRNed37LvA" target="_blank" rel="noopener"
 &gt;Kimi Code colocou o Claude Code pra chorar&lt;/a&gt; — mano deyvin&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=fXSwktXhAOM" target="_blank" rel="noopener"
 &gt;Affordable Claude Code in 3 steps&lt;/a&gt; — Abhishek Veeramalla&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=NClayXM8pU0" target="_blank" rel="noopener"
 &gt;Give ChatGPT and Claude the Same Memory&lt;/a&gt; — Nate Herk&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=0sDKQMO23xE" target="_blank" rel="noopener"
 &gt;Hermes AI Just Learned to Read Books&lt;/a&gt; — Julian Goldie SEO&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=BNjzXcEXmg4" target="_blank" rel="noopener"
 &gt;This NEW Claude Prompting Technique (gauntlet-loop)&lt;/a&gt; — Jay E RoboNuggets&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=vOK0Cdbk-Ps" target="_blank" rel="noopener"
 &gt;I Let Claude Opus 5 Run a Business Alone for 9 Days&lt;/a&gt; — Ben Awad&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=jI4ZVB_MPhU" target="_blank" rel="noopener"
 &gt;Andrej Karpathy Just Fixed Claude Code&amp;rsquo;s Biggest Weakness&lt;/a&gt; — Dream Labs AI&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://www.youtube.com/watch?v=mH70ny2LcX4" target="_blank" rel="noopener"
 &gt;OpenAI&amp;rsquo;s Model Got Too Dangerous So They Locked It Up&lt;/a&gt; — Universe of AI&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>