본문 바로가기

728x90
반응형

전체 글

(3506)
Prime Agent, 지속형 IPython 커널과 서브 에이전트로 바꾸는 AI 코딩 에이전트의 실행 방식 AI 코딩 에이전트가 단순히 코드를 생성하는 수준을 넘어 장시간에 걸쳐 복잡한 개발 작업을 수행하려면 무엇이 필요할까요?Prime Intellect가 공개한 오픈소스 프로젝트 Prime Agent는 이 질문에 기존과 다른 방식으로 접근합니다. 고정된 툴 스키마와 컨텍스트 압축에 의존하는 대신, 지속적으로 유지되는 Python 실행 환경과 서브 에이전트 구조를 활용해 AI가 작업을 수행하는 방식 자체를 바꿨습니다.핵심에는 Recursive Language Model(RLM)과 Continual Harness라는 두 가지 개념이 있습니다. 여기에 Persistent IPython Kernel을 중심으로 한 실행 구조와 /refine 기반의 자기 개선 기능을 결합했습니다.Prime Agent는 Opus 5를 ..
Wan 3.0은 어디까지 진화할까? WanSong·Wan-Dancer·Wan-Streamer가 보여주는 차세대 영상 생성 기술 Alibaba의 Wan 시리즈가 영상 생성 모델을 넘어 오디오, 모션, 실시간 상호작용까지 영역을 넓히고 있습니다.특히 2026년 7월 Wan-Dancer, WanSong, Wan-Streamer가 잇따라 공개되면서 관심이 커지고 있습니다. 세 모델 모두 ‘Wan 2.x’라는 이름을 사용하지 않지만, 기존 Wan 모델의 기술적 기반을 이어가면서 서로 다른 멀티모달 영역을 다루고 있다는 공통점이 있습니다.이 때문에 이 세 가지 연구가 향후 Wan 3.0을 구성할 기술적 요소가 아니냐는 전망이 나오고 있습니다.다만 중요한 점이 있습니다. 현재 Alibaba가 Wan 3.0의 출시일이나 모델 카드, 기술 보고서를 공식적으로 발표한 것은 아닙니다. 따라서 Wan 3.0에 관한 내용은 공개된 논문과 모델을 통해 ..
바이트댄스 시드리얼타임, 보고 듣고 먼저 반응하는 전이중 멀티모달 AI 공개 AI와 대화할 때마다 질문을 먼저 던지고 답변을 기다리는 방식은 지금까지 음성 AI를 사용하는 익숙한 모습이었습니다. 하지만 AI가 주변 상황을 계속 바라보고 들으면서 사용자가 말하기 전에도 필요한 순간에 먼저 반응한다면 이야기가 달라집니다.바이트댄스가 공개한 ‘시드리얼타임(SeedRealtime)’은 이런 형태의 실시간 AI를 목표로 합니다. 음성, 영상, 텍스트를 하나의 모델에서 동시에 처리하고, 상황을 이해한 뒤 적절한 순간에 먼저 말을 걸 수 있는 전이중(Full-Duplex) 멀티모달 AI입니다.특히 기존처럼 음성인식(ASR), 비전언어모델(VLM), 음성합성(TTS)을 각각 연결하는 방식에서 벗어나 하나의 엔드투엔드 모델에서 인식과 이해, 추론, 응답을 병렬로 처리한다는 점이 핵심입니다.이번 ..
Meta의 AI 코딩 전략, 개발자가 고친 800건의 실수에 주목하는 이유 AI가 코드를 작성하는 시대가 되면서 중요한 질문도 달라지고 있습니다. 단순히 AI가 얼마나 정확하게 코드를 생성하는지가 아니라, AI가 잘못 작성한 코드를 개발자가 어떻게 수정하는지도 AI 성능을 높이는 중요한 데이터가 될 수 있기 때문입니다.Meta는 이 지점을 AI 코딩 전략에 활용하고 있습니다. 수천 명의 소프트웨어 엔지니어가 내부 AI 코딩 에이전트인 MetaCode를 사용하고, AI가 잘못 만든 코드를 직접 수정하는 과정에서 발생한 결과를 모델 개선에 활용하는 방식입니다.자료에 따르면 이미 7,000명의 주간 활성 사용자가 800건 이상의 수정 사례를 제출했습니다. Meta는 이 과정에서 확보한 수정 사례를 Muse Spark 1.1 개선에 활용했으며, 향후 Watermelon이라는 이름의 모..
Liquid AI LFM2.5-2.6B 공개, 2.69B 파라미터로 구현한 온디바이스 AI 에이전트 AI 모델이 커질수록 더 많은 작업을 처리할 수 있지만, 동시에 실행에 필요한 컴퓨팅 자원과 비용도 커집니다. 특히 스마트폰이나 노트북, 로봇처럼 제한된 환경에서 AI를 실행하려면 모델의 성능뿐만 아니라 메모리 사용량과 추론 속도, 배포 방식까지 함께 고려해야 합니다.Liquid AI가 공개한 LFM2.5-2.6B는 이런 환경을 겨냥한 온디바이스 에이전트 모델입니다. 총 2.69B 파라미터를 사용하면서도 131,072토큰의 컨텍스트 윈도우와 툴 호출, 멀티스텝 작업을 지원하며, 모델 가중치를 공개해 다양한 환경에 직접 배포할 수 있도록 했습니다.특히 외부 API를 거치지 않고 디바이스에서 추론을 수행할 수 있다는 점에서 데이터 보안과 운영 비용을 중요하게 보는 환경에서 주목할 만합니다.이번 글에서는 LF..
MiniMax-H3 Turbo LoRA, 20스텝에서 4스텝으로 줄인 AI 영상 생성 기술 AI 영상 생성에서 결과물의 품질만큼 중요한 것이 바로 생성 속도입니다. 영상 한 편을 만들기 위해 반복적인 샘플링 과정이 필요하다면, 짧은 영상이라도 생성에 상당한 시간이 걸릴 수 있기 때문입니다.최근 MiniMax-H3를 기반으로 약 20스텝이 필요했던 생성 과정을 4스텝까지 줄이는 MiniMax-H3 Turbo LoRA가 공개되면서 관심을 받고 있습니다. 제공된 자료에 따르면 4스텝 샘플링을 통해 기존 대비 약 5배 수준의 샘플링 시간 단축을 기대할 수 있으며, 영상뿐 아니라 영상과 동기화된 스테레오 오디오까지 함께 생성할 수 있습니다.다만 현재 버전은 아직 Preview 단계입니다. 최신 ckpt850 체크포인트에서 4스텝에서도 높은 선명도를 확보했지만, 플라스틱처럼 보이는 피부나 과도하게 선명한..
AI는 이제 모델이 아니라 하네스를 개선한다: 재귀적 자기 개선을 이끄는 하네스 엔지니어링 AI의 자기 개선이라고 하면 흔히 AI가 자신의 모델 가중치를 직접 수정하고 더 똑똑한 모델로 거듭나는 모습을 떠올립니다. 하지만 현재 연구에서 주목받는 현실적인 접근은 조금 다릅니다. 모델 자체를 바로 바꾸기보다 AI가 사고하고, 도구를 사용하고, 정보를 기억하고, 결과를 평가하고, 작업을 반복하는 방식을 개선하는 것입니다.이때 핵심이 되는 것이 바로 하네스(Harness)입니다.하네스는 단순한 프롬프트가 아니라 AI 모델을 둘러싸고 실행을 조율하는 소프트웨어 시스템입니다. 워크플로, 도구 호출, 맥락 관리, 메모리, 서브에이전트, 평가, 권한 제어 등을 포함하며 AI가 실제 환경에서 어떻게 행동할지를 결정합니다.최근에는 이 하네스 자체를 AI가 반복적으로 수정하고 평가하는 연구가 등장하고 있습니다. ..
LLM은 왜 새로운 과학 법칙을 스스로 만들기 어려울까? ‘귀추적 점프’와 AI의 한계 생성형 AI는 주어진 데이터를 분석하고 규칙을 찾아내는 능력과, 주어진 규칙에서 답을 도출하는 능력을 빠르게 발전시키고 있습니다. 수학 문제를 풀고, 복잡한 코드를 작성하고, 과학적 가설을 탐색하는 수준까지 올라왔습니다.그렇다면 한 가지 질문이 남습니다.AI가 충분히 많은 데이터를 보고 충분히 많이 추론한다면, Einstein처럼 새로운 과학 이론을 스스로 만들어낼 수 있을까요?OpenReview에 공개된 논문 LLMs Cannot Jump는 이 질문에 대해 흥미로운 관점을 제시합니다. 현재 AI가 과학적 발견의 일부 과정인 귀납(Induction)과 연역(Deduction)은 빠르게 자동화하고 있지만, 감각적 경험에서 새로운 설명이나 공리로 넘어가는 귀추(Abduction)의 ‘점프’에는 여전히 근본적..
Qwen3.8 Max, Agentic Index 종합 1위… AI 모델 선택 기준이 지능에서 에이전트 성능으로 확대된다 AI 모델을 선택할 때 가장 먼저 확인하는 것은 보통 벤치마크 점수와 순위입니다. 하지만 실제 업무에 AI를 적용하려면 단순히 지능 점수가 높은 모델을 고르는 것만으로는 충분하지 않습니다. 도구를 얼마나 잘 사용하는지, 복잡한 작업을 어떻게 계획하고 수행하는지, 비용과 실행 시간은 어느 정도인지, API 제공 환경에서도 성능이 유지되는지까지 함께 살펴봐야 하기 때문입니다.이러한 관점에서 주목할 만한 평가 결과가 공개됐습니다. Qwen3.8 Max가 Artificial Analysis의 Agentic Index에서 종합 1위를 기록했습니다. Agentic Index는 단순한 질문 답변 능력이 아니라 도구 사용, 계획, 자율성, 복합 문제 해결 등 에이전트 워크플로에서 중요한 능력을 평가하는 지표입니다.이번..
Warp Agent CLI 핵심 기능과 특징: 터미널에서 활용하는 다중 모델 코딩 에이전트 AI 코딩 에이전트를 사용하다 보면 코드 작성뿐 아니라 실제 개발 환경에서 명령을 실행하고, 셸 상태를 유지하고, 여러 저장소와 원격 환경을 오가는 작업까지 에이전트가 처리해야 할 필요가 있습니다. 특히 터미널 중심으로 개발하는 사용자라면 에이전트가 셸과 얼마나 자연스럽게 연결되는지가 중요한 기준이 됩니다.Warp Agent CLI는 Warp Terminal의 다중 모델 코딩 에이전트를 독립형 CLI로 제공하는 도구입니다. Ghostty, iTerm 2, VS Code, Windows·Mac 기본 터미널 등 사용자가 원하는 환경에서 실행할 수 있으며, 터미널과 에이전트 사이의 연결을 관리하는 멀티플렉싱 구조를 통해 기존 CLI 에이전트보다 셸 상태와 터미널 작업에 유연하게 대응하는 것을 목표로 합니다.여..

728x90
반응형