제 노트북에선 매일 밤 11시에 스크립트가 하나 돌아갑니다. 그날 올라온 AI 관련 유튜브 영상을 긁어와서, 조회수 높은 것들만 골라 요약해두는 녀석이에요. 아침에 커피 마시면서 그걸 훑는 게 요즘 루틴입니다.
지난 한 주치를 몰아서 봤는데, 이번엔 좀 이상했어요. 보통 이맘때면 “이 모델이 얼마나 똑똑한가” 얘기로 도배가 되는데, 이번 주는 성능 얘기가 거의 없었습니다. 대신 가격표만 보고 있더군요.
세 줄 요약
- 가격이 무너졌어요. 중국 오픈모델(Kimi K3·Qwen 3.8·DeepSeek V4)이랑 메타 뮤즈 코드가 같은 주에 쏟아졌습니다.
- 근데 “100배 싸다"에는 조건이 있어요. 메타의 그 요금제, 내 코드를 학습 데이터로 내주는 대가입니다.
- 에이전트는 기억을 갖기 시작했습니다. 쉬는 동안 스스로 정리하고, 도구 사이를 옮겨 다니는 기억이 나왔어요.
이번 주엔 다들 가격 얘기만 했습니다
제일 많이 본 영상 제목이 이걸 그대로 보여줍니다. “중국이 페이블 5를 이기는 100배 싼 AI를 내놨다.” 17만 회예요.
문샷의 Kimi K3는 2.8조 파라미터짜리 오픈소스 모델입니다. 어떤 리뷰어가 3D 전투 게임을 만들어보게 시켰는데, 클로드 페이블 5보다 3.3배쯤 싸게 끝냈다고 하더군요.
저도 AI로 게임 만들기 시리즈를 매주 하고 있어서 이 대목이 남 일 같지 않았어요. 게임 만들기는 될 때까지 계속 다시 돌리는 작업이라, 모델 단가가 그대로 부담이 되거든요. “이거 한 번 더 돌려볼까” 하다가 멈칫한 적이 여러 번입니다.
메타는 뮤즈 코드라는 터미널 코딩 에이전트를 베타로 냈습니다. /effort로 얼마나 깊게 생각할지, /model로 어떤 모델 쓸지 바꾸는 방식인데, 솔직히 클로드 코드랑 거의 똑같아요.
화제가 된 건 요금이었습니다. 컨트리뷰터 티어를 쓰면 캐시된 입력 토큰 100만 개당 0.15달러에서 0.002달러로 떨어집니다.
이게 무슨 의미냐면, 지금까지 “비싸서 못 해본” 것들을 해볼 수 있게 됐다는 겁니다. 코드베이스 전체 훑기, PR 수백 개 분류, 될 때까지 반복하는 리팩터링 같은 것들요. 비용 때문에 접어둔 아이디어 있으면 지금 다시 꺼내볼 만합니다.
근데 “100배 싸다"를 그대로 믿긴 좀
여기서 한 번 멈춰야 해요. 그 가격엔 조건이 붙어 있습니다.
컨트리뷰터 티어가 싼 이유는 개발 데이터를 넘기기 때문입니다. 개인 토이 프로젝트면 별생각 없이 쓰겠지만, 회사 코드나 고객 정보가 오가는 작업이라면 계산이 완전히 달라지죠. 같은 기준으로 보면 안 됩니다.
공정하게 덧붙이면, “100배 싸다"고 제목을 뽑은 그 영상도 이 조건은 짚었습니다. 메타가 컨트리뷰터 모델을 쓰면 콘텐츠가 제품 개선에 쓰일 수 있다고 명시했다고요. 다만 제목만 보고 넘어가면 놓치기 쉬운 대목이라 한 번 더 적습니다.
평가도 갈렸어요. 뮤즈 코드를 다룬 리뷰어는 속도랑 가격은 인정하면서도 “완벽하진 않다"며 환각 문제를 같이 짚었습니다. Kimi K3도 시연 한 번 봤다고 우열을 말하긴 이르고요.
리뷰어들이 입을 모은 말이 있습니다. 벤치마크 말고 본인 실제 작업으로 직접 돌려보라는 거였어요.

참고로 코딩 에이전트 실력을 재는 공개 기준은 이미 있습니다. 프린스턴이 2023년에 내놓은 SWE-bench인데, 실제 깃허브 이슈를 AI가 스스로 해결하는지를 봐요. 마케팅 문구보다는 이런 기준이나 내 업무로 확인하는 게 낫습니다.
AI가 잠을 자기 시작했습니다
가격 말고 눈에 띈 게 하나 더 있어요. 기억이랑 자율성입니다.
안드레이 카파시가 지적한 AI의 약점이 이거였습니다. 프롬프트를 받을 때만 학습한다는 것. 사람은 자는 동안에도 뇌가 하루치를 정리하는데 AI는 그게 없다는 거죠. 앤트로픽은 여기에 착안해서 쉬는 동안 과거 세션을 되짚어 기억을 정리하는 드리밍 기능을 넣었습니다. 아직 기업 고객용이지만요.
클로드 Opus 5한테 9일간 혼자 돈을 벌어보라고 시킨 실험도 있었어요. 초반엔 삽질하다가 결국 3D 스키 게임을 만들어서 상금을 탔습니다. 55달러로 시작해서 87달러가 됐어요. 액수는 귀엽지만 자율 운영이 굴러갔다는 게 포인트죠.
재밌는 건 AI가 돈 벌 방법으로 게임 제작을 골랐다는 겁니다. 짧게 만들고 바로 평가받는 영역이라 그랬겠죠. 게임 랩 1편에서 제가 “AI로 게임 만들어 돈 벌기, 진짜 될까?“라고 물었던 게 떠올라서 좀 묘했습니다.
건틀렛 루프라는 프롬프팅 기법도 화제였어요. 메인 에이전트가 서브 에이전트를 여럿 띄우고, 거기에 비평 담당을 붙여서 기준 만족할 때까지 계속 돌리는 방식입니다.

이것도 뿌리가 있습니다. Reflexion·Self-Refine(NeurIPS 2023) 계열 연구인데, AI가 자기 결과물을 스스로 평가하고 고쳐서 다시 하면 정확도가 오른다는 게 확인돼 있어요.
다만 소개한 사람 본인이 처음부터 다 맡기진 말라고 했습니다. 어느 정도 방향 잡힌 걸 다듬을 때 써야 효과적이라고요.
이번 주에 건진 것들
당장 해볼 만한 것들만 추렸어요.
게이트웨이로 모델 갈아끼우기. 도구는 그대로 두고 뒤에 붙는 모델만 바꾸는 방식입니다. OpenRouter는 CLI 설치하고, 계정 만들고, API 키 연결하면 끝이에요. DeepSeek이나 GLM 같은 오픈모델이 클로드 코드 뒤에 붙습니다.
페일오버 묶어두기. OmniRoute에서 여러 모델을 묶고 우선순위나 순환 방식을 걸어둘 수 있어요. 한 모델이 한도에 걸리면 알아서 다음 모델로 넘어가서 작업이 안 끊깁니다.
아예 내 컴퓨터에서 돌리는 방법도 있죠. 예전에 게이밍 노트북으로 나만의 LLM 돌리기에 정리해뒀는데, 이번 주 오픈모델들이 쏟아지면서 그 선택지가 훨씬 현실적이 됐습니다.
문서를 스킬로 학습시키기. Hermes 에이전트의 /learn 명령에 파일 경로를 주면 그 내용을 영구히 기억합니다. 사내 문서나 업무 매뉴얼 한 번 넣어두면 세션 바뀌어도 남아 있어서, 매번 파일 붙여넣는 짓을 안 해도 돼요.
기억을 도구 사이에 공유하기. Walrus Memory를 연결하면 챗GPT랑 클로드가 같은 기억을 씁니다. 도구 옮길 때마다 배경 설명 다시 하는 낭비가 사라지죠.
음성은 일꾼 말고 지휘자로. 챗GPT 보이스에 직접 일 시키지 말고 “스레드 만들어서 이거 처리해줘” 식으로 다른 스레드에 넘기라는 팁이었어요. 음성 모델은 가벼운 놈이라 무거운 작업은 넘기는 게 결과가 낫다고 합니다.
하나만 남긴다면 이겁니다
여기부턴 이번 주 뉴스가 아니라 반년 뒤에도 유효할 얘기예요.
모델은 하나 고르는 게 아니라, 작업 난이도에 따라 나눠 쓰는 것입니다.

| 단계 | 무엇을 | 어떤 모델 |
|---|---|---|
| 설계·계획 | 아키텍처, 요구사항 정리 | 제일 똑똑한 비싼 모델 |
| 실행·반복 | 코드 작성, 변환, 정리 | 저가·오픈모델 |
| 검증 | 결과 확인, 리뷰 | 중간 |
이게 그냥 유행어는 아니에요. 학계에선 모델 캐스케이딩이라고 부르고, 2023년 스탠퍼드의 FrugalGPT 연구가 대표적입니다. 싼 모델로 대부분을 처리하고 어려운 것만 비싼 모델에 넘기면 비용은 줄이면서 성능은 지킬 수 있다는 내용이죠.
이번 주에 달라진 건 이 표의 가운데 칸입니다. ‘실행’에 쓸 수 있는 선택지가 갑자기 확 넓어졌어요. 원칙 자체는 그대로고요.
그늘도 같이 봐야죠
OpenAI 아스트라는 출시가 미뤄졌습니다. 자체 안전 기준에서 사이버보안 항목이 ‘치명적’ 등급에 걸렸거든요. 사람 개입 없이 제로데이 공격을 만들어낼 수 있는 수준이라는 뜻입니다.
투자 쪽에선 거품 논쟁이 커졌어요. 논리는 이렇습니다. 오픈모델이랑 저가 경쟁이 퍼지면, 지금까지 깔고 가던 인프라 수요 전망이 과대평가였을 수 있다는 거죠.
한 채널은 제본스의 역설(“싸지면 오히려 총사용량이 는다”)이 무비판적으로 퍼질 때를 특히 조심하라고 했습니다. 그럴듯한 논리일수록 검증 없이 반복되기 쉬우니까요. 저도 이 문장 좋아했는데, 좀 찔리더군요.
나머지는 짧게
- 무료 사용자 기본 모델이 GPT-5.6 Luna로 바뀌었습니다.
- 제미나이 노트북 2.0은 자료에서 슬라이드랑 쇼츠 영상까지 뽑아줍니다.
- 클로드 코드 플러그인 5종이 돌았어요. Omni Route, Claude-mem, Headroom, Claude Code Setup, Task Observer.
- 클로드 디자인에 모션 그래픽이 붙었는데, 백엔드나 라이브 URL은 여전히 없습니다. 실서비스로 바로 이어지진 않아요. 프로토타입용으로 보는 게 맞습니다.
- 핀테크 회사 Ramp는 개발 전 과정에 에이전트를 붙여서 CI 시간을 3배 줄였다고 합니다. 비결이 좀 의외였는데, “어떻게 하라"가 아니라 “뭘 달성하라"만 지시하는 거였대요.
이번 주엔 이거 하나만
게이트웨이 하나 연결해보세요. OpenRouter든 OmniRoute든, 지금 쓰는 도구 뒤에 오픈모델 하나만 붙여보는 겁니다.
돈 아끼자는 게 목적이 아니에요. 갈아끼울 수 있는 상태를 만들어두자는 겁니다. 다음에 또 판이 흔들릴 때(또 흔들립니다), 준비된 사람만 갈아탈 수 있으니까요.
혹시 이미 오픈모델로 갈아타신 분 있나요? 저는 아직 클로드 코드를 주력으로 쓰는데, 이번 주 보면서 슬슬 실험은 해봐야겠다 싶더군요. 써보신 분들 후기가 궁금합니다.
매주 유튜브 AI 영상 수십 편을 훑어서, 흐름이 되는 것만 골라 “내 작업에 뭐가 달라지나"로 옮기고 연구 근거랑 과장 필터를 붙입니다. 이번 편은 2026년 8월 4~10일 조회수 상위 42편을 봤어요. 성능·가격 수치는 각 영상에서 주장된 값이라 직접 검증하진 못했고, 그래서 조건이랑 반론을 본문에 같이 적었습니다. 연구로 인용한 FrugalGPT·SWE-bench·Reflexion은 공개된 논문이에요.
출처 영상
- China Just Dropped an AI 100x Cheaper That Beats Claude Fable 5 — Vaibhav Sisinty
- Meta’s Claude Code clone is INSANELY cheap — Theo
- Kimi Code colocou o Claude Code pra chorar — mano deyvin
- Affordable Claude Code in 3 steps — Abhishek Veeramalla
- Give ChatGPT and Claude the Same Memory — Nate Herk
- Hermes AI Just Learned to Read Books — Julian Goldie SEO
- This NEW Claude Prompting Technique (gauntlet-loop) — Jay E RoboNuggets
- I Let Claude Opus 5 Run a Business Alone for 9 Days — Ben Awad
- Andrej Karpathy Just Fixed Claude Code’s Biggest Weakness — Dream Labs AI
- OpenAI’s Model Got Too Dangerous So They Locked It Up — Universe of AI