
AI가 코드를 작성하는 시대가 되면서 중요한 질문도 달라지고 있습니다. 단순히 AI가 얼마나 정확하게 코드를 생성하는지가 아니라, AI가 잘못 작성한 코드를 개발자가 어떻게 수정하는지도 AI 성능을 높이는 중요한 데이터가 될 수 있기 때문입니다.
Meta는 이 지점을 AI 코딩 전략에 활용하고 있습니다. 수천 명의 소프트웨어 엔지니어가 내부 AI 코딩 에이전트인 MetaCode를 사용하고, AI가 잘못 만든 코드를 직접 수정하는 과정에서 발생한 결과를 모델 개선에 활용하는 방식입니다.
자료에 따르면 이미 7,000명의 주간 활성 사용자가 800건 이상의 수정 사례를 제출했습니다. Meta는 이 과정에서 확보한 수정 사례를 Muse Spark 1.1 개선에 활용했으며, 향후 Watermelon이라는 이름의 모델 포스트 트레이닝에도 사용할 예정입니다.
이 전략이 주목받는 이유는 단순히 코드 생성 모델을 하나 더 만드는 데 있지 않습니다. AI가 실제 개발 현장에서 어떤 실수를 하고, 숙련된 개발자가 그 실수를 어떻게 바로잡는지를 학습 데이터로 확보한다는 점에 있습니다.
MetaCode, AI가 만든 코드를 개발자가 직접 수정하는 구조
Meta는 소프트웨어 엔지니어들이 실제 업무에서 MetaCode를 사용하도록 하고 있습니다.
지난달 Meta의 Applied AI Engineering 조직을 이끄는 Maher Saba 부사장은 사내 엔지니어들에게 매주 최소 하나의 코드 ‘diff’를 MetaCode를 통해 제출해 달라고 요청했습니다.
여기서 중요한 부분은 단순히 AI가 작성한 코드를 모으는 것이 아닙니다.
MetaCode가 먼저 작업을 수행하고, 그 결과가 잘못됐을 경우 개발자가 직접 코드를 수정합니다. 이후 테스트나 코드 리뷰를 거쳐 실제로 승인되는 과정까지 이어집니다.
즉, Meta가 확보할 수 있는 데이터에는 다음과 같은 흐름이 포함됩니다.
개발자가 요청한 작업 → MetaCode의 최초 답변 → AI 코드의 문제점 → 개발자의 수정 → 테스트 및 리뷰 → 승인된 코드
이 과정이 AI 코딩 모델을 개선하는 데 중요한 이유가 있습니다.
완성된 코드만 보면 어떤 코드가 정상적으로 작동하는지는 알 수 있지만, AI가 처음에 어떤 실수를 했고 개발자가 왜 특정 부분을 수정했는지까지 파악하기는 어렵습니다.
반면 MetaCode를 통해 실제 개발 과정에서 만들어진 데이터를 활용하면 AI가 어떤 문제를 반복적으로 일으키는지 확인할 수 있습니다.
공개 코드 데이터와 다른 ‘실수 데이터’의 가치
공개 저장소에는 이미 수많은 소프트웨어 코드가 존재합니다. AI 코딩 모델을 학습시키는 데 활용할 수 있는 방대한 코드가 있다는 의미입니다.
하지만 공개 저장소에 남아 있는 것은 대부분 최종적으로 사용되는 코드입니다.
AI가 처음 어떤 코드를 작성했는지, 그 코드에서 무엇이 잘못됐는지, 개발자가 어떤 부분을 변경했는지, 변경 이후 어떤 테스트와 리뷰를 거쳤는지까지 하나의 과정으로 기록되는 것은 아닙니다.
MetaCode는 이 차이를 활용할 수 있습니다.
예를 들어 AI가 특정 기능을 구현했지만 개발자가 코드를 확인한 결과 요구사항을 제대로 반영하지 못했다면, 개발자는 해당 코드를 수정합니다. 이후 테스트와 리뷰를 거쳐 최종 코드가 승인될 수 있습니다.
이때 중요한 데이터는 단순히 ‘최종적으로 올바른 코드’가 아닙니다.
AI가 처음에는 어떻게 접근했고, 어디에서 틀렸으며, 사람이 어떤 방식으로 문제를 해결했는가가 함께 남는다는 점입니다.
이런 사례가 충분히 쌓이면 Meta는 AI 코딩 에이전트가 반복적으로 발생시키는 문제를 찾아낼 수 있습니다.
특히 인위적으로 코딩 문제를 만들어 AI에게 풀게 하는 것이 아니라, 실제 개발 과정에서 자연스럽게 발생한 오류를 활용할 수 있다는 점이 특징입니다.
7,000명의 개발자와 800건 이상의 수정 사례
Meta가 이 방식에 기대를 거는 이유는 참여 규모에서도 확인할 수 있습니다.
자료에 따르면 7,000명의 주간 활성 사용자가 이미 800건 이상의 수정 사례를 제출했습니다.
Meta는 엔지니어들의 참여를 유도하기 위해 사내 프로필에 기여한 변경 횟수에 따라 색상이 다른 배지를 추가하기도 했습니다.
결국 Meta가 만들고 있는 것은 단순한 AI 코딩 도구가 아닙니다.
개발자가 AI를 사용하고, AI가 결과를 내놓고, 개발자가 이를 검토하고 수정하는 과정 자체를 하나의 데이터 수집 구조로 연결하고 있는 것입니다.
다만 여기에는 주의할 부분도 있습니다.
Meta가 모든 코드 패치와 코드 리뷰를 자동으로 학습 데이터로 사용한다고 밝힌 것은 아닙니다. 또한 이렇게 확보한 수정 데이터를 구체적으로 어떤 방식으로 준비하고 가중치를 부여하는지도 공개하지 않았습니다.
자료에서 설명하는 것은 MetaCode가 잘못된 결과를 내놓았을 때 엔지니어가 이를 수정하고 제출하는 의도적인 과정입니다.
따라서 ‘Meta의 모든 사내 코드가 AI 학습 데이터가 된다’고 해석하는 것은 자료의 범위를 넘어서는 설명입니다.
MetaCode와 Muse Spark 1.1, 그리고 Watermelon
Meta의 AI 코딩 전략을 이해하려면 MetaCode와 모델의 관계도 구분해서 볼 필요가 있습니다.
MetaCode는 Meta가 내부에서 사용하는 AI 코딩 에이전트입니다. 반면 Muse Spark 1.1은 Meta가 2026년 7월 9일 공개한 모델입니다.
Meta에 따르면 Muse Spark 1.1은 내부 개발자와 연구자들이 이미 일상적으로 사용하고 있으며, 기존 Muse Spark보다 코딩 능력이 크게 향상됐습니다.
또한 MetaCode를 통해 개발자가 수정한 결과가 Muse Spark 1.1 개선에 이미 활용됐으며, 향후 Watermelon이라는 이름으로 알려진 모델의 포스트 트레이닝에도 사용될 예정입니다.
이 구조에서 중요한 것은 AI 코딩 에이전트의 실제 사용 과정이 모델 개선으로 다시 연결되는 순환 구조입니다.
AI가 코드를 작성하고 끝나는 것이 아니라,
AI 코드 생성 → 개발자의 검증 → 오류 수정 → 수정 사례 확보 → 모델 개선
이라는 흐름을 만들 수 있습니다.
이 과정이 충분히 반복된다면 AI가 실제 개발 환경에서 자주 발생시키는 문제를 파악하고 개선하는 데 활용할 수 있습니다.
Meta의 AI 코딩 모델은 경쟁사와 얼마나 차이가 날까
Meta가 실제 개발 데이터를 확보하려는 배경에는 AI 코딩 경쟁에서 성능을 높여야 한다는 과제도 있습니다.
Meta는 2026년 7월 9일 Muse Spark 1.1을 공개했습니다. 하지만 자료에 따르면 공개 벤치마크에서는 여전히 가장 강력한 모델들과 차이가 있습니다.
Muse Spark 1.1은 장시간 소프트웨어 엔지니어링 작업 113개를 테스트하는 DeepSWE 1.1 리더보드에서 53%를 기록했습니다.
자료에서 제시한 출시 당시 비교 수치는 다음과 같습니다.
- Muse Spark 1.1: 53%
- GPT-5.5: 67%
- Claude Opus 4.8: 59%
이후 경쟁 모델의 성능은 다시 높아졌습니다.
2026년 7월 중순 출시된 GPT-5.6 Sol은 73%, 7월 24일 출시된 Claude Opus 5는 74%를 기록한 것으로 자료는 설명합니다.
이를 보면 Meta가 AI 코딩 분야에서 경쟁사들을 따라잡아야 하는 상황이라는 점을 확인할 수 있습니다.
다만 벤치마크 수치를 해석할 때는 한 가지 중요한 주의점이 있습니다.
DeepSWE는 동일한 mini-swe-agent 하네스를 사용해 모델을 테스트하지만 MetaCode 자체를 테스트하는 것은 아닙니다.
따라서 MetaCode의 개선이 곧 Muse Spark 1.1의 DeepSWE 점수 향상으로 이어진다고 단정해서는 안 됩니다.
자료에서도 이 두 가지를 직접 연결할 수 있는 근거가 Meta로부터 공개된 것은 아니라고 설명합니다.
그럼에도 해당 벤치마크는 Meta가 현재 어떤 경쟁 상황에 놓여 있는지 보여주는 참고 자료가 될 수 있습니다.
성능만큼 중요한 것은 AI 코딩 비용
AI 코딩 에이전트의 경쟁에서 성능만 중요한 것은 아닙니다.
실제 기업 환경에서 AI 코딩 에이전트를 대규모로 사용하려면 비용도 중요한 문제가 됩니다.
코딩 에이전트는 저장소를 탐색하고, 코드를 작성하고, 테스트를 실행하고, 결과를 확인한 뒤 다시 수정하는 작업을 반복할 수 있습니다.
이 과정에서 많은 토큰이 사용됩니다.
특히 수천 명의 엔지니어가 AI 코딩 에이전트를 사용하고 일부 작업이 장시간 실행된다면 전체 비용은 상당한 규모로 커질 수 있습니다.
자료에 따르면 Muse Spark 1.1의 Meta API 비용은 다음과 같습니다.
- 입력 토큰: 100만 토큰당 1.25달러
- 출력 토큰: 100만 토큰당 4.25달러
이는 당시 Anthropic과 OpenAI의 프런티어 모델보다 낮은 수준의 가격으로 소개됐습니다.
Meta 입장에서는 이 부분이 중요한 경쟁력이 될 수 있습니다.
자체 모델의 성능을 충분히 높일 수 있다면 외부 AI 기업의 모델을 사용할 때마다 비용을 지불하는 대신, 자체 모델을 활용해 사내 엔지니어들의 코딩 작업을 지원할 수 있기 때문입니다.
하지만 AI 모델 가격 경쟁도 빨라지고 있다
문제는 경쟁사들도 가만히 있지 않는다는 점입니다.
자료에 따르면 OpenAI는 7월 말 GPT-5.6 Luna의 비용을 80% 낮췄으며, 입력 토큰 가격은 100만 토큰당 0.20달러까지 내려갔습니다.
이는 효율적인 중국 오픈 웨이트 모델의 압박 등과 관련된 가격 경쟁의 영향을 받은 것으로 설명됩니다.
이러한 변화는 Meta의 전략을 조금 더 복잡하게 만듭니다.
Meta의 모델이 경쟁사 프런티어 모델보다 저렴하다는 점은 분명한 장점이 될 수 있습니다.
하지만 경쟁사 모델의 가격 역시 빠르게 내려가고 있다면 단순히 ‘저렴한 모델’이라는 것만으로는 충분한 경쟁력을 확보하기 어려워질 수 있습니다.
결국 Meta가 확보해야 할 것은 낮은 비용과 높은 성능의 조합입니다.
그리고 실제 개발 현장에서 얻는 코드 수정 데이터는 이 목표를 달성하기 위한 하나의 수단이 될 수 있습니다.
Meta만 실제 개발 데이터를 바라보는 것은 아니다
이런 전략은 Meta만의 움직임도 아닙니다.
자료에서는 Alibaba의 Qwen 사례도 함께 소개합니다.
Alibaba는 Qwen 모델을 16일 동안 자율 코딩 작업에 투입했고, 그 과정에서 발생한 모든 커밋을 GitHub에 공개했습니다.
Meta와 방식은 다르지만 방향성에는 공통점이 있습니다.
바로 실제 소프트웨어 개발 과정에서 발생하는 데이터를 AI 코딩 모델의 발전과 연결하려는 시도입니다.
기존에는 AI 코딩 모델의 능력을 평가하기 위해 정해진 벤치마크나 인위적으로 만들어진 코딩 문제를 활용하는 방식이 중요했습니다.
하지만 실제 개발 환경에서는 훨씬 다양한 문제가 발생합니다.
AI가 요구사항을 잘못 이해할 수도 있고, 기존 코드와 충돌할 수도 있으며, 테스트 과정에서 문제가 발견될 수도 있습니다.
개발자는 이러한 문제를 찾아내고 수정합니다.
따라서 실제 개발 과정은 AI 코딩 에이전트가 어떤 문제를 해결하지 못하는지 확인할 수 있는 지속적인 학습 신호가 될 수 있습니다.
AI 코딩 경쟁의 핵심이 달라지고 있다
Meta의 움직임을 보면 AI 코딩 경쟁의 초점이 조금씩 달라지고 있다는 점을 생각해 볼 수 있습니다.
과거에는 AI가 코드를 얼마나 잘 생성하는지가 중요한 문제였다면, 이제는 그 다음 단계가 중요해지고 있습니다.
AI가 코드를 작성한 뒤 개발자가 이를 검증하고, 문제가 발견되면 수정하고, 그 결과를 다시 AI 개선에 활용하는 구조입니다.
즉, 중요한 것은 단순한 코드 생성 능력만이 아닙니다.
실제 개발 환경에서 발생하는 오류와 수정 과정을 얼마나 잘 확보하고 활용할 수 있는가도 중요한 경쟁 요소가 될 수 있습니다.
MetaCode는 바로 이 지점을 노리고 있습니다.
개발자가 AI의 결과를 확인하고 수정하는 과정이 계속 반복된다면 Meta는 AI가 현실적인 소프트웨어 개발 업무에서 어떤 문제를 일으키는지 더 많이 파악할 수 있습니다.
그리고 이러한 데이터를 Muse Spark 1.1이나 향후 Watermelon과 같은 모델의 개선에 활용할 수 있습니다.
MetaCode는 앞으로 어떤 역할을 하게 될까
Meta가 앞으로 더 많은 코딩 및 생산성 도구를 계획하고 있다는 점도 주목할 부분입니다.
Mark Zuckerberg Meta CEO는 2분기 실적 발표에서 더 많은 코딩 및 생산성 도구가 로드맵에 있다고 밝혔습니다.
MetaCode가 향후 이러한 도구 가운데 하나로 발전할 수도 있고, 계속해서 내부용 도구로 남을 수도 있습니다.
현재 단계에서 확실하게 확인할 수 있는 것은 MetaCode가 Meta의 AI 코딩 전략에서 단순한 코드 생성 도구 이상의 의미를 가지고 있다는 점입니다.
MetaCode가 코드를 작성할 때마다 발생하는 결과와 그 결과를 개발자가 수정하는 과정이 축적될 수 있기 때문입니다.
결국 Meta가 주목하는 것은 AI가 항상 정답을 내놓는 모습이 아닙니다.
오히려 AI가 틀렸을 때 사람이 어떻게 고치는지에 주목하고 있습니다.
AI의 ‘실수’가 새로운 학습 자원이 될 수 있다
Meta의 AI 코딩 전략에서 가장 눈에 띄는 부분은 개발자의 코드 수정 과정을 모델 개선과 연결하려는 시도입니다.
MetaCode를 통해 AI가 먼저 코드를 작성하고, 개발자가 그 결과를 검토한 뒤 오류를 수정합니다. Meta는 이 과정에서 발생한 수정 사례를 확보하고 있으며, 자료에 따르면 7,000명의 주간 활성 사용자가 800건 이상의 수정 사례를 제출했습니다.
이 데이터는 단순히 완성된 코드만 모으는 것과는 다른 의미를 가질 수 있습니다.
AI가 무엇을 잘못했는지, 개발자가 무엇을 수정했는지, 그리고 어떤 코드가 최종적으로 승인됐는지를 하나의 개발 과정으로 바라볼 수 있기 때문입니다.
Meta가 해결해야 할 과제도 분명합니다.
Muse Spark 1.1은 공개 벤치마크에서 경쟁사 모델보다 낮은 점수를 기록했으며, 경쟁사 역시 성능과 가격을 빠르게 개선하고 있습니다. 따라서 Meta는 자체 모델의 성능을 높이는 동시에 비용 경쟁력까지 확보해야 합니다.
그런 상황에서 실제 개발 현장에서 만들어지는 코드 수정 데이터는 Meta에게 중요한 자원이 될 가능성이 있습니다.
다만 Meta가 이러한 데이터를 구체적으로 어떻게 처리하고 학습에 반영하는지는 아직 공개되지 않았습니다. 또한 MetaCode의 개선과 Muse Spark 1.1의 공개 벤치마크 성능을 직접적으로 연결해서 해석하는 것도 주의해야 합니다.
그럼에도 이번 사례가 보여주는 방향은 분명합니다.
앞으로의 AI 코딩 경쟁은 단순히 누가 코드를 더 잘 생성하는가에 그치지 않을 수 있습니다.
누가 실제 개발 환경에서 더 많은 경험을 확보하고, AI의 실패와 개발자의 수정 과정을 효과적으로 모델 개선에 연결하는가가 중요한 경쟁 요소가 될 수 있습니다.
Meta가 개발자의 ‘800건 이상의 수정 사례’에 주목하는 이유도 바로 여기에 있습니다.
The 800 mistakes that could reshape Meta's AI coding strategy
Meta is turning its engineers' code fixes into training data for its AI coding agent, MetaCode, as it races to close the gap with OpenAI and Anthropic.
thenewstack.io

'인공지능' 카테고리의 다른 글
| Wan 3.0은 어디까지 진화할까? WanSong·Wan-Dancer·Wan-Streamer가 보여주는 차세대 영상 생성 기술 (0) | 2026.08.07 |
|---|---|
| 바이트댄스 시드리얼타임, 보고 듣고 먼저 반응하는 전이중 멀티모달 AI 공개 (0) | 2026.08.07 |
| Liquid AI LFM2.5-2.6B 공개, 2.69B 파라미터로 구현한 온디바이스 AI 에이전트 (0) | 2026.08.07 |
| MiniMax-H3 Turbo LoRA, 20스텝에서 4스텝으로 줄인 AI 영상 생성 기술 (0) | 2026.08.07 |
| AI는 이제 모델이 아니라 하네스를 개선한다: 재귀적 자기 개선을 이끄는 하네스 엔지니어링 (0) | 2026.08.07 |