전체 글 (3508) 썸네일형 리스트형 Qwen3.8 Max, Agentic Index 종합 1위… AI 모델 선택 기준이 지능에서 에이전트 성능으로 확대된다 AI 모델을 선택할 때 가장 먼저 확인하는 것은 보통 벤치마크 점수와 순위입니다. 하지만 실제 업무에 AI를 적용하려면 단순히 지능 점수가 높은 모델을 고르는 것만으로는 충분하지 않습니다. 도구를 얼마나 잘 사용하는지, 복잡한 작업을 어떻게 계획하고 수행하는지, 비용과 실행 시간은 어느 정도인지, API 제공 환경에서도 성능이 유지되는지까지 함께 살펴봐야 하기 때문입니다.이러한 관점에서 주목할 만한 평가 결과가 공개됐습니다. Qwen3.8 Max가 Artificial Analysis의 Agentic Index에서 종합 1위를 기록했습니다. Agentic Index는 단순한 질문 답변 능력이 아니라 도구 사용, 계획, 자율성, 복합 문제 해결 등 에이전트 워크플로에서 중요한 능력을 평가하는 지표입니다.이번.. Warp Agent CLI 핵심 기능과 특징: 터미널에서 활용하는 다중 모델 코딩 에이전트 AI 코딩 에이전트를 사용하다 보면 코드 작성뿐 아니라 실제 개발 환경에서 명령을 실행하고, 셸 상태를 유지하고, 여러 저장소와 원격 환경을 오가는 작업까지 에이전트가 처리해야 할 필요가 있습니다. 특히 터미널 중심으로 개발하는 사용자라면 에이전트가 셸과 얼마나 자연스럽게 연결되는지가 중요한 기준이 됩니다.Warp Agent CLI는 Warp Terminal의 다중 모델 코딩 에이전트를 독립형 CLI로 제공하는 도구입니다. Ghostty, iTerm 2, VS Code, Windows·Mac 기본 터미널 등 사용자가 원하는 환경에서 실행할 수 있으며, 터미널과 에이전트 사이의 연결을 관리하는 멀티플렉싱 구조를 통해 기존 CLI 에이전트보다 셸 상태와 터미널 작업에 유연하게 대응하는 것을 목표로 합니다.여.. 생성형 AI와 소프트웨어 엔지니어링에 대한 8가지 오해, 개발 생산성의 진짜 의미 생성형 AI가 코드를 작성해주면 개발자는 더 빠르게 일할 수 있을까요? 어느 정도는 맞습니다. 하지만 코드 작성 속도가 빨라졌다고 해서 소프트웨어 개발 전체가 같은 비율로 빨라지는 것은 아닙니다.실제 소프트웨어 엔지니어링에는 코드 작성 외에도 설계, 회의, 코드 검토, 테스트, 레거시 코드 이해, 시스템 통합, 유지보수 등 다양한 업무가 포함됩니다. 따라서 AI가 개발 생산성에 미치는 영향을 제대로 이해하려면 단순히 "코드를 얼마나 빨리 작성했는가"만 바라봐서는 안 됩니다.특히 생성형 AI가 개발자를 10배 더 생산적으로 만든다거나, AI가 작성한 코드의 비율이 높을수록 생산성이 높다는 식의 주장은 실제 개발 환경의 복잡성을 충분히 반영하지 못할 수 있습니다.이 글에서는 소프트웨어 엔지니어링과 생성형 A.. Seedance 2.5·MiniMax H3 영상 생성 모델 비교, 같은 프롬프트에서 드러난 결과 차이 최근 영상 생성 AI는 단순히 문장을 영상으로 바꾸는 수준을 넘어, 프롬프트에 담긴 인물과 사물의 관계, 움직임, 장면의 세부 요소까지 얼마나 정확하게 구현하는지가 중요한 평가 기준이 되고 있습니다.이번 비교에서는 동일한 프롬프트를 기반으로 독일 셰퍼드가 BMW 오토바이를 타고, 뒷좌석에는 칼리코 고양이가 함께 탑승한 15초짜리 원테이크 코미디 영상을 생성해 영상 모델별 결과를 비교했습니다.비교 대상으로는 Seedance 2.5, MiniMax H3, Grok, Gemini Veo가 사용됐으며, 제공된 평가 내용에서는 특히 Seedance 2.5와 MiniMax H3의 결과가 소개됐습니다.그렇다면 동일한 조건에서 두 모델은 어떤 차이를 보여줬을까요?동일한 프롬프트로 영상 생성 결과 비교이번 테스트의 핵심.. 100배 저렴한 오픈 모델로 GPT-5.6 Sol 수준의 검색 정확도 구현하기 AI 에이전트가 복잡한 질문에 답하려면 단순히 한 번 검색하는 것만으로는 부족합니다. 질문을 여러 단계로 나누고, 필요한 정보를 반복해서 검색한 뒤 결과를 종합하는 다중 홉 검색이 중요해지고 있습니다.문제는 검색 과정이 복잡해질수록 비용과 지연 시간도 함께 증가한다는 점입니다. 프런티어 모델을 검색 과정마다 반복 호출하면 요청 하나를 처리하는 데 10초 이상이 걸리고 약 0.03달러의 비용이 발생할 수 있습니다.이런 상황에서 주목받는 접근 방식이 소형 오픈 모델에 검색 작업에 특화된 강화학습 후처리를 적용하는 방법입니다. 제공된 내용에 따르면 Castform으로 강화학습 후처리한 4B 오픈 소스 모델은 GPT-5.6 Sol과 같은 수준의 검색 정확도를 달성하면서 요청 비용을 100분의 1 수준으로 낮추는.. Uber 검색 플랫폼의 진화: Elasticsearch에서 OpenSearch까지 Uber의 서비스에서 검색은 단순히 원하는 정보를 찾는 기능이 아닙니다. Uber Eats에서 수많은 음식점과 메뉴 중 원하는 상품을 찾거나, Uber에서 목적지를 검색하고 적절한 드라이버를 연결하는 과정까지 검색과 랭킹 기술이 핵심 역할을 담당합니다.문제는 Uber와 같은 대규모 서비스에서는 검색 대상과 데이터가 계속 변한다는 점입니다. 수많은 사용자가 동시에 검색하고, 드라이버의 위치가 실시간으로 바뀌며, 음식점과 메뉴 정보도 지속적으로 업데이트됩니다. 따라서 검색 플랫폼에는 높은 성능과 확장성뿐만 아니라 데이터의 최신성과 안정적인 운영까지 요구됩니다.Uber의 검색 플랫폼은 이러한 요구에 맞춰 지속적으로 변화해왔습니다. 초기에는 Elasticsearch를 활용해 빠르게 규모를 확장했고, 실시간 검색.. Qwen3.8-Max, 16일 동안 스스로 코딩했다: 265개 커밋이 보여준 AI 자율 개발의 현재 AI 코딩 기술은 이제 코드를 한두 번 생성해주는 수준을 넘어 장시간 프로젝트를 수행하는 단계로 향하고 있습니다.Alibaba가 공개한 Qwen3.8-Max의 사례가 이를 잘 보여줍니다. Qwen3.8-Max는 약 16일 동안 사람의 직접적인 도움 없이 CLI 도구를 개발했으며, 이 과정에서 265개의 커밋과 127개의 Pull Request를 만들고 151개의 GitHub 이슈를 처리했습니다.특히 이 작업은 단순히 코드를 한 번 생성하고 끝나는 방식이 아닙니다. AI가 작업 결과를 확인하고 다음에 무엇을 해야 할지 판단하면서 개발을 이어갔다는 점에서 의미가 있습니다.이번 글에서는 Qwen3.8-Max가 어떤 모델인지부터 16일간 진행한 자율 코딩 사례, 논문 결과 재현과 칩 설계 최적화 사례, 장시간 .. Muse Code와 Muse Spark 1.2 공개, 장시간 복잡한 개발 작업을 수행하는 AI 코딩 에이전트 AI 코딩 도구가 단순히 코드를 작성하는 수준을 넘어 대규모 저장소를 이해하고, 작업을 계획하고, 코드를 수정한 뒤 결과까지 검증하는 방향으로 발전하고 있습니다. 이번에 공개된 Muse Code 베타와 Muse Spark 1.2는 이러한 흐름을 보여주는 사례입니다.Muse Code는 Muse Spark 1.2를 기반으로 동작하는 터미널 코딩 에이전트입니다. 복잡한 소프트웨어 엔지니어링 작업을 대상으로 계획 수립, 코드 작성, 결과 검증을 수행하며, 여러 개의 지속적인 백그라운드 에이전트를 활용해 작업을 진행합니다.Muse Spark 1.2 역시 코드 생성뿐 아니라 복잡한 디버깅, 코드베이스 이해, 장시간 이어지는 개발 작업에 초점을 맞춰 개선됐습니다. 특히 Muse Code와 함께 학습하는 방식을 적용해.. Pi의 미니멀리즘이 AI 코딩 하네스의 경쟁력이 되는 이유 AI 코딩 에이전트의 성능을 높이기 위해 더 많은 도구와 프롬프트를 제공하는 방식이 일반적으로 떠오르고 있습니다. 하지만 기능이 많아질수록 AI가 처리해야 할 컨텍스트와 실행 과정도 늘어나고, 결국 비용과 복잡성이 함께 커질 수 있습니다.Pi는 이와 다른 방향을 선택합니다. 기본 도구를 4개로 제한하고 시스템 프롬프트와 도구 정의를 합쳐도 1,000토큰 미만으로 구성하는 최소형 코딩 하네스를 지향합니다. 필요한 기능은 기본으로 모두 제공하는 대신 사용자가 직접 확장할 수 있도록 설계했습니다.이러한 미니멀리즘은 단순히 기능을 줄이는 데 그치지 않습니다. Databricks의 실제 코드 작업 벤치마크에서는 하네스에 따라 같은 모델과 추론 강도를 사용해도 작업당 비용이 2배 이상 차이날 수 있는 것으로 나타났.. MiniMax H3, 33B 영상 생성 모델 가중치 공개…텍스트·이미지·영상·오디오를 하나로 활용 AI 영상 생성 기술이 텍스트를 영상으로 바꾸는 수준을 넘어 이미지, 영상, 오디오 등 다양한 입력 데이터를 함께 활용하는 방향으로 발전하고 있습니다.중국 AI 기업 MiniMax는 이러한 흐름에 맞춰 최신 영상 생성 모델인 H3의 일부 가중치를 오픈소스로 공개했습니다. H3는 330억(33B) 파라미터 규모의 영상 생성 모델로, 텍스트뿐 아니라 이미지·영상·오디오를 입력으로 활용할 수 있다는 점이 특징입니다.최대 15초 길이의 영상을 24FPS로 생성할 수 있으며 스테레오 오디오와 다양한 화면 비율, 11개 언어의 음성 생성도 지원합니다. 특히 이번 공개에서는 단순히 하나의 모델만 제공하는 것이 아니라, 일반적인 Text-to-Video부터 여러 이미지·영상·오디오 레퍼런스를 활용하는 방식까지 지원하는.. 이전 1 ··· 3 4 5 6 7 8 9 ··· 351 다음