
AI 코딩 도구가 단순히 코드를 작성하는 수준을 넘어 대규모 저장소를 이해하고, 작업을 계획하고, 코드를 수정한 뒤 결과까지 검증하는 방향으로 발전하고 있습니다. 이번에 공개된 Muse Code 베타와 Muse Spark 1.2는 이러한 흐름을 보여주는 사례입니다.
Muse Code는 Muse Spark 1.2를 기반으로 동작하는 터미널 코딩 에이전트입니다. 복잡한 소프트웨어 엔지니어링 작업을 대상으로 계획 수립, 코드 작성, 결과 검증을 수행하며, 여러 개의 지속적인 백그라운드 에이전트를 활용해 작업을 진행합니다.
Muse Spark 1.2 역시 코드 생성뿐 아니라 복잡한 디버깅, 코드베이스 이해, 장시간 이어지는 개발 작업에 초점을 맞춰 개선됐습니다. 특히 Muse Code와 함께 학습하는 방식을 적용해 실제 에이전트 환경에서의 코딩 활용성을 높이는 데 집중했습니다.
Muse Code, 대규모 저장소의 복잡한 개발 작업을 수행
Muse Code는 단순한 코드 생성 도구가 아니라 소프트웨어 엔지니어링 작업 자체를 수행하는 터미널 기반 코딩 에이전트를 지향합니다.
복잡한 개발 작업에서는 코드를 한 번 생성하는 것으로 끝나지 않습니다. 기존 코드 구조를 파악하고, 변경할 부분을 계획하고, 실제 코드를 작성한 다음 결과를 확인하고 수정하는 과정이 반복됩니다.
Muse Code는 이러한 작업 흐름을 대상으로 설계됐습니다.
주요 작업은 다음과 같습니다.
- 변경 사항 계획
- 코드 작성
- 결과 검증
- 대규모 저장소를 대상으로 한 작업 수행
- 여러 지속형 백그라운드 에이전트와의 작업 조율
특히 여러 작업을 각각 독립적으로 처리하는 방식보다는 하나의 작업을 수행하는 동안 필요한 정보를 지속적으로 확보하고 다음 단계로 이어가는 구조에 초점을 맞추고 있습니다.
비동기 백그라운드 에이전트로 작업 흐름 강화
Muse Code의 주요 특징 가운데 하나는 Async Background Agents입니다.
Muse Code는 기본적인 에이전트 루프에 여러 비동기 백그라운드 에이전트를 결합합니다. 이 백그라운드 에이전트는 특정 작업이 발생할 때마다 새롭게 생성되는 일회성 에이전트가 아니라, 세션이 진행되는 동안 지속적으로 활성화된 상태를 유지합니다.
이러한 구조에는 두 가지 목적이 있습니다.
첫 번째는 중복된 정보 수집을 줄이는 것입니다.
에이전트가 매번 같은 정보를 다시 조사할 필요 없이 세션 동안 필요한 작업을 지속적으로 수행할 수 있습니다.
두 번째는 복잡한 여러 단계의 작업에서 지연과 추가적인 사용자 개입을 줄이는 것입니다.
백그라운드 에이전트는 다음에 수행해야 할 작업을 진행하면서 언제 메인 에이전트와 정보를 공유할지 스스로 결정합니다. 이를 통해 메인 에이전트가 모든 작업을 직접 처리하지 않고 여러 전문화된 백그라운드 작업의 도움을 받을 수 있도록 구성했습니다.
결과적으로 Muse Code는 단순히 사용자의 지시를 받고 한 번 응답하는 방식보다는, 긴 작업 과정에서 필요한 작업을 계속 이어가는 에이전트 구조를 갖추고 있습니다.
Runtime Design, 작업 기록을 기반으로 중단된 지점부터 복구
장시간 진행되는 AI 작업에서 중요한 문제 가운데 하나는 작업 중간에 문제가 발생했을 때 어디까지 진행됐는지를 정확하게 유지하는 것입니다.
Muse Code는 이를 위해 로컬 이벤트 로그를 사용하는 Runtime Design을 적용했습니다.
모델 호출, 도구 실행, 승인, 편집 등의 작업이 하나의 이벤트 로그에 계속 추가됩니다. 이 로그는 실행 상태를 기록하는 단일 기준점 역할을 합니다.
Muse Code가 설명하는 이 구조의 핵심은 다음과 같습니다.
Replay-exact와 Restart-safe
즉, 실행 과정이 이벤트 로그에 남기 때문에 작업이 중단되더라도 이전 상태를 바탕으로 정확하게 재현하고 다시 시작할 수 있도록 설계됐습니다.
예를 들어 장시간 진행되는 개발 작업 도중 시스템이 중단되더라도 처음부터 모든 작업을 다시 시작하는 것이 아니라, 중단된 지점에서 작업을 이어갈 수 있는 구조입니다.
이는 특히 여러 단계가 연결된 장기 개발 작업에서 중요한 특징입니다. 작업 시간이 길어질수록 중간에 발생하는 오류나 중단이 전체 작업을 다시 시작해야 하는 문제로 이어질 수 있기 때문입니다.
Muse Code는 이벤트 로그를 통해 이러한 문제에 대응하고 장시간 실행되는 작업에서도 개발 흐름이 중단되지 않도록 설계했습니다.
기본 제공 Skills로 계획부터 목표 달성까지 지원
Muse Code에는 여러 가지 기본 Skills도 함께 제공됩니다.
대표적인 기능이 /plan, /grill, /goal입니다.
/plan
/plan은 작업을 계획으로 전환합니다.
특히 승인 절차가 포함된 계획을 만들도록 설계돼 있어 작업을 바로 실행하기 전에 어떤 방식으로 진행할지 확인할 수 있습니다.
/grill
/grill은 작성된 계획을 검증하는 데 사용됩니다.
계획이 충분히 견고한지 지속적으로 검토하고 스트레스 테스트하는 방식으로 계획을 점검합니다.
/goal
/goal은 지정된 목표를 성공적으로 달성하는 데 초점을 맞춥니다.
즉, Muse Code의 기본 Skills는 단순히 코드를 생성하는 기능에만 머무르지 않고 계획 수립 → 계획 검증 → 목표 달성이라는 작업 흐름을 지원합니다.
터미널에 동영상 파일을 입력해 결과물을 만드는 활용 사례
Muse Code의 활용 예시로 제시된 사례도 흥미롭습니다.
사용자가 집 내부를 촬영한 fly-through 영상 파일을 MP4 형식으로 터미널에 입력하면 Muse Code가 해당 영상을 해석하고, 이를 기반으로 시각적으로 풍부한 휴가용 주택 마케팅 및 예약 페이지를 생성합니다.
이 사례는 Muse Code가 단순한 텍스트 기반 코드 작성에만 국한되지 않고, 입력된 자료를 해석한 뒤 실제 결과물을 만들어내는 개발 작업으로 연결할 수 있음을 보여줍니다.
Muse Spark 1.2, 코딩에 초점을 맞춰 개선된 최신 모델
Muse Spark 1.2는 Muse Spark 1.1을 기반으로 코딩 관련 기능을 개선한 업데이트입니다.
주요 개선 영역은 다음과 같습니다.
- 코드 생성
- 복잡한 디버깅
- 코드베이스 이해
- 엔드투엔드 개발 워크플로
- 장시간 이어지는 코딩 작업
이번 버전에서는 코딩 작업에 대한 학습 컴퓨팅 규모를 크게 확대하는 동시에 학습 환경의 다양성도 넓혔습니다.
그렇다고 코딩 영역에만 초점을 맞춘 것은 아닙니다. 자료에서는 Muse Spark 1.2가 일반적인 에이전트 작업에서도 기존의 강점을 유지한다고 설명합니다.
즉, Muse Spark 1.2의 방향은 단순한 코드 자동완성 성능을 높이는 데 그치지 않고 복잡한 개발 과정 전체를 이해하고 수행할 수 있는 코딩 모델로 확장하는 데 있습니다.
Muse Code와 Muse Spark 1.2를 함께 학습한 이유
Muse Spark 1.2의 또 다른 특징은 Muse Code와의 Co-Training입니다.
Muse Spark 1.2는 Muse Code와 함께 학습해 두 시스템이 결합됐을 때 모델의 성능과 코딩 사용성을 최대한 발휘할 수 있도록 구성됐습니다.
학습 과정에는 다음과 같은 요소가 포함됐습니다.
- Rejection-sampled harness trajectories
- Goals, compaction, subagents를 위한 레시피 최적화
- Muse Code 도구 세트 통합
- Harness 호환성 향상
여기서 중요한 점은 모델 자체의 성능만 높이는 것이 아니라 모델이 실제 에이전트 환경에서 도구를 사용하고 장기 작업을 수행하는 방식까지 함께 고려했다는 것입니다.
따라서 Muse Spark 1.2는 독립적인 코딩 모델로만 보는 것보다 Muse Code라는 에이전트 환경과 함께 이해할 필요가 있습니다.
Long-Horizon 학습으로 장시간 코딩 작업에 대응
Muse Spark 1.2는 장시간 이어지는 Long-Horizon Coding Task를 대상으로 광범위한 학습을 진행했습니다.
여기에는 다음과 같은 작업이 포함됩니다.
- 전체 저장소 생성
- 대규모 엔드투엔드 프로젝트
- 자동화된 리서치 작업
장시간 작업에서는 단순히 뛰어난 코드를 한 번 생성하는 능력만으로 충분하지 않습니다.
처음 세운 계획을 유지하면서 여러 작업을 순서대로 처리해야 하고, 시간이 지나면서 확보한 정보를 계속 활용해야 합니다.
Muse Spark 1.2는 이를 위해 세 가지 요소를 활용합니다.
Planning
작업 순서를 계획해 복잡한 작업을 단계적으로 진행합니다.
Goal Conditioning
작업이 길어지더라도 처음 지정한 목표와 방향을 유지하도록 합니다.
Context Compaction
작업 과정에서 확보한 지식 가운데 지속적으로 필요한 정보를 유지해 장기 작업을 이어갈 수 있도록 합니다.
이러한 방식은 Muse Spark 1.2가 단순한 단기 코드 생성보다 긴 개발 과정에서 지속적으로 목표를 추적하는 능력에 초점을 맞추고 있음을 보여줍니다.
Self-Improvement로 복잡한 지시사항에 대한 대응력 강화
Muse Spark 1.2에는 Self-Improvement 방식도 활용됐습니다.
먼저 Muse Spark 1.1을 사용해 어려운 코딩 환경과 명령어 수행 템플릿을 생성했습니다. 이후 모델이 생성한 후보 결과물이 해당 요구사항을 얼마나 잘 충족했는지를 평가했습니다.
이 과정을 통해 대규모 학습 데이터를 구축하고 Muse Spark 1.2의 학습에 활용했습니다.
결국 이전 모델이 만들어낸 환경과 평가 결과를 다음 모델의 학습 과정에 활용하는 구조입니다.
자료에서는 이와 같은 자기 개선 과정이 Muse Spark 1.2가 이전 모델보다 복잡한 지시사항을 더 정확하게 따르는 데 도움을 줬다고 설명합니다.
1,000회 이상의 도구 호출로 수행한 GPU 커널 최적화
Muse Spark 1.2의 장기 코딩 능력을 확인하기 위한 사례로 GPU 커널 최적화 테스트도 진행됐습니다.
테스트에서는 1,000회 이상의 도구 호출을 수행했으며, 최대 24시간 동안 작업이 이어졌습니다.
Muse Code의 에이전트 코딩 환경에서 모델은 다음 작업을 반복합니다.
- GPU 커널 작성
- 컴파일
- 프로파일링
- 성능 측정
- 기존 구현과 비교
- 결과를 바탕으로 추가 최적화
즉, 한 번 코드를 생성하고 종료하는 것이 아니라 결과를 확인한 뒤 다시 개선하는 반복적인 개발 과정을 수행합니다.
테스트 대상은 NVIDIA Hopper GPU를 위한 KDA와 MLA 커널이었습니다.
특히 KDA 테스트에서는 기존 FLA Triton 구현을 기준으로 삼았으며, FLA와 같은 서드파티 커널 라이브러리를 직접 가져와 사용하는 방식은 허용하지 않았습니다.
대신 Triton에서 알고리즘을 직접 구현하면서 전문적인 커널 최적화 지식을 적용하도록 했습니다.
Muse Spark 1.2는 이 과정에서 청크 병렬 준비 커널과 순차적인 청크 간 스캔을 결합하고, 일반적인 Fusion과 Tiling뿐 아니라 KDA에 특화된 최적화까지 적용했습니다.
자료에서는 이러한 과정을 통해 제공된 기준 구현보다 상당한 성능 향상을 지속적으로 달성했다고 설명합니다.
이 사례에서 주목할 부분은 단순히 코드를 생성했다는 사실이 아닙니다.
작성 → 컴파일 → 프로파일링 → 분석 → 수정 → 재검증이라는 반복적인 작업을 장시간 수행했다는 점입니다.
이는 Muse Code와 Muse Spark 1.2가 목표로 하는 장기 코딩 에이전트의 방향성을 잘 보여주는 사례라고 볼 수 있습니다.
Muse Spark 1.2와 Muse Code의 핵심 특징 정리
두 기술을 각각 살펴보면 역할을 구분해서 이해할 수 있습니다.
Muse Code는 실제 개발 작업을 수행하는 에이전트 환경에 가깝습니다.
대규모 저장소에서 작업을 계획하고 코드를 작성하며, 도구와 백그라운드 에이전트를 활용해 결과를 검증합니다. 또한 이벤트 로그를 활용해 장시간 작업을 이어갈 수 있도록 구성했습니다.
반면 Muse Spark 1.2는 이러한 작업을 수행하는 데 초점을 맞춘 코딩 모델입니다.
코드 생성과 디버깅, 코드베이스 이해를 개선했으며, Long-Horizon 학습과 Self-Improvement를 통해 복잡하고 긴 개발 작업에 대응하도록 학습됐습니다.
특히 두 기술을 함께 학습했다는 점에서 차이가 있습니다.
Muse Spark 1.2의 모델 능력과 Muse Code의 에이전트 환경을 별개로 최적화하기보다, 모델과 개발 환경이 함께 작동하는 상황을 고려해 학습했다는 것이 핵심입니다.
Muse Spark 1.2의 제공 현황
제공된 자료에 따르면 Muse Spark 1.2는 현재 Muse Code와 Meta Model API에서 사용할 수 있으며, 글로벌 접근 범위도 확대됐습니다.
또한 이후 새로운 Harness 기능과 더욱 강력한 모델을 포함한 추가적인 발전도 예고하고 있습니다.
Muse Code를 설치하는 방법은 다음과 같이 안내됐습니다.
curl -fsSL https://dev.meta.ai/install.sh | bash
자료에서 안내된 설치 대상은 macOS와 Linux입니다.
Muse Code와 Muse Spark 1.2의 핵심은 단순히 더 나은 코드를 생성하는 AI를 만드는 데 있지 않습니다.
대규모 저장소를 이해하고, 작업을 계획하고, 코드를 작성하고, 결과를 검증하며, 필요하다면 다시 수정하는 전체적인 소프트웨어 엔지니어링 과정을 AI가 지속적으로 수행할 수 있도록 만드는 데 초점이 맞춰져 있습니다.
Muse Code는 지속적인 백그라운드 에이전트, 이벤트 로그 기반 Runtime Design, 기본 제공 Skills를 통해 이러한 작업 환경을 구성했습니다.
Muse Spark 1.2는 코드 생성과 디버깅, 코드베이스 이해를 개선하는 동시에 Long-Horizon 학습과 Self-Improvement를 적용했습니다. 특히 Muse Code와 함께 학습하면서 실제 에이전트 환경에서의 코딩 활용성을 높이는 방향을 택했습니다.
1,000회 이상의 도구 호출과 최대 24시간에 걸친 GPU 커널 최적화 사례는 이러한 방향을 구체적으로 보여줍니다. AI가 한 번의 코드 생성으로 작업을 끝내는 것이 아니라 작성, 실행, 측정, 개선을 반복하는 장기적인 개발 작업을 수행하는 데 초점을 맞추고 있기 때문입니다.
앞으로 이러한 접근 방식이 발전한다면 AI 코딩 도구의 역할도 단순한 코드 생성 보조에서 더 복잡한 개발 작업을 지속적으로 수행하는 에이전트형 개발 환경으로 확대될 가능성을 보여줍니다.
현재 Muse Code와 Muse Spark 1.2는 이러한 방향으로 나아가기 위한 하나의 사례이며, 향후 예고된 새로운 Harness 기능과 더욱 강력한 모델이 어떤 개발 경험을 제공할지 주목할 필요가 있습니다.
Introducing Muse Code and Muse Spark 1.2
Introducing Muse Code, a terminal coding agent powered by Muse Spark 1.2, with persistent background agents, repository-scale execution, and built-in verification.
research.meta.ai

'인공지능' 카테고리의 다른 글
| Uber 검색 플랫폼의 진화: Elasticsearch에서 OpenSearch까지 (0) | 2026.08.07 |
|---|---|
| Qwen3.8-Max, 16일 동안 스스로 코딩했다: 265개 커밋이 보여준 AI 자율 개발의 현재 (0) | 2026.08.07 |
| Pi의 미니멀리즘이 AI 코딩 하네스의 경쟁력이 되는 이유 (0) | 2026.08.06 |
| MiniMax H3, 33B 영상 생성 모델 가중치 공개…텍스트·이미지·영상·오디오를 하나로 활용 (0) | 2026.08.06 |
| AI 코딩 에이전트가 코드만 읽어서는 부족한 이유, CodeAlmanac으로 관리하는 코드베이스 지식 (0) | 2026.08.04 |