본문 바로가기

728x90
반응형

전체 글

(3696)
LaunchVideo: Opus 5.5로 제품 소개 영상을 자동 생성하는 기술 제품 소개 영상을 제작하려면 제품 정보를 정리하고, 화면을 디자인하고, 애니메이션을 구현한 뒤 영상으로 렌더링하는 과정이 필요합니다. 이러한 작업을 자동화하기 위해 AI가 영상 자체를 생성하는 대신, 웹 애니메이션 코드를 작성하고 이를 실제 영상으로 변환하는 접근 방식이 등장했습니다.LaunchVideo는 Opus 5.5를 활용해 제품 URL이나 설명을 기반으로 제품 소개 영상을 자동 생성하는 서비스입니다. 영상 생성 모델을 사용하지 않고 HTML과 웹 애니메이션을 코드로 작성한 뒤, 각 프레임을 렌더링해 MP4 파일로 변환합니다.이 글에서는 LaunchVideo의 영상 생성 원리부터 에이전트 아키텍처, 렌더링 과정, 실행 환경 및 배포 방식까지 살펴봅니다.1. LaunchVideo란 무엇인가?Launc..
Ordewell: Claude Code·Codex·OpenCode를 조율하는 멀티 에이전트 오케스트레이터 AI 코딩 에이전트를 활용하면 코드 작성과 수정 작업을 자동화할 수 있지만, 복잡한 개발 목표를 여러 작업으로 나누고 실행 순서를 관리하는 과정은 여전히 중요합니다. 여러 작업을 서로 다른 에이전트에 배정하고, 작업 간 의존성을 관리하며, 결과가 제대로 완료됐는지 확인하는 체계가 필요하기 때문입니다.Ordewell은 하나의 개발 목표를 여러 작업으로 분리하고, 각 작업을 Claude Code, Codex, OpenCode에 배정해 실행을 관리하는 멀티 에이전트 오케스트레이터입니다. 작업별로 에이전트와 모델, 추론 수준을 다르게 지정할 수 있으며, 독립적인 작업은 병렬로 실행하고 선행 결과가 필요한 작업은 정해진 순서에 따라 처리할 수 있습니다.이번 글에서는 Ordewell의 주요 기능과 작업 계획 수립 ..
Stripe의 사내 AI 플랫폼 Kai: 업무 자동화 아키텍처와 실제 생산성 개선 사례 Stripe는 영업, 재무, 데이터 분석, 규정 준수 등 다양한 업무를 지원하기 위해 사내 AI 플랫폼 Kai를 구축했습니다. 기존에는 각 부서가 개별적으로 AI 에이전트를 개발하면서 기능이 중복되고 품질과 유지보수를 관리하기 어려운 문제가 있었습니다. Kai는 이러한 문제를 해결하기 위해 공통 AI 인프라와 부서별 전문성을 결합한 플랫폼입니다.Kai는 직원들이 기존 업무 환경에서 AI 에이전트를 활용할 수 있도록 지원하며, 1,000개 이상의 스킬과 도구를 연결해 복잡한 지식 업무를 처리합니다. 발표 자료에 따르면 주간 활성 사용자 비율은 83%에 도달했으며, Kai를 사용한 영업 담당자는 미사용 주보다 영업 활동과 계약 성사 건수에서 높은 성과를 보였습니다.이번 글에서는 Stripe가 Kai를 구축한..
TypeSafe AI Jev 활용 가이드: 타입 기반 의사결정부터 비동기 처리까지 AI 모델을 실제 서비스에 적용할 때는 자연어 응답을 생성하는 것만으로 충분하지 않습니다. 고객 문의를 분류하고, 요청의 긴급도를 평가하며, 특정 조건에 따라 작업을 실행하려면 모델의 판단 결과를 프로그램에서 바로 활용할 수 있어야 합니다.TypeSafe AI의 Jev는 이러한 요구에 맞춰 설계된 System One 모델입니다. 일반적인 텍스트 생성 대신 입력된 상태와 미리 정의한 질문을 바탕으로 선택 결과, 점수, 참일 확률을 반환합니다. 개발자는 이 결과를 Python 코드와 결합해 의사결정 흐름을 구성할 수 있습니다.이 글에서는 Jev의 핵심 질문 유형인 Choice, Score, Noul을 살펴보고, 확신도 기반 라우팅, 복합 점수화, 함수 호출, 여러 질문의 동시 처리 및 운영 환경을 위한 비동..
Google Gemini 3.8 Flash TTS·Flash-Lite TTS 공개: 프롬프트 기반 음성 설계와 정교한 음성 생성 Google이 Gemini Audio 제품군에 새로운 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다. 이번 모델은 텍스트를 음성으로 변환하는 기능을 넘어, 자연어 프롬프트를 통해 목소리의 특성과 대사 전달 방식까지 세밀하게 제어할 수 있다는 점이 특징입니다.Google은 창의적인 음성 연출과 캐릭터 제작에 초점을 맞춘 Flash TTS, 대규모 음성 생성과 비용 효율성을 고려한 Flash-Lite TTS로 모델을 구분했습니다. 또한 100개 이상의 언어와 방언을 대상으로 한 음성 설계, 2,000개 이상의 제작용 음성 라이브러리, 장시간 음성 생성, 다중 화자 대화 및 음성 복제 기능을 제공합니다.이번 글에서는 두 모..
PI-Desktop, AI 에이전트를 위한 독립형 데스크톱 워크스페이스 터미널에서는 AI 에이전트가 작업하고, IDE에서는 코드 자동완성을 사용하고, 브라우저에서는 또 다른 AI 모델을 실행하는 식으로 여러 도구를 오가며 작업하는 경우가 많습니다. 기능은 충분하지만 각각의 환경이 분리되어 있어 프로젝트와 세션, 에이전트의 작업 흐름을 하나로 관리하기는 쉽지 않습니다.PI-Desktop은 이런 문제에 초점을 맞춘 모듈형 데스크톱 애플리케이션입니다. AI 에이전트를 기존 IDE나 터미널에 종속된 기능으로 다루는 대신, 프로젝트와 세션, 리뷰, 프리뷰, 에이전트를 하나의 독립적인 워크스페이스에서 관리할 수 있도록 구성한 것이 핵심입니다.PI-Desktop이란?PI-Desktop은 macOS, Windows, Linux에서 사용할 수 있는 AI 에이전트 워크플로우용 데스크톱 애플리..
Gemini 4 Argon, 100만 토큰과 장기 추론으로 복잡한 업무를 수행하는 AI 모델 복잡한 소프트웨어 개발부터 법률·금융 조사, 사이버 방어까지 AI가 한 번의 짧은 응답을 넘어 장시간 이어지는 작업을 수행해야 하는 업무가 늘고 있습니다. Google은 이러한 장기·다단계 작업을 목표로 Gemini 4 Argon을 발표했습니다.Gemini 4 Argon은 출력 토큰 한도를 기존 64K에서 100만 토큰으로 확대하고, 장시간 추론과 자율적인 작업 수행에 초점을 맞춘 것이 특징입니다. Google 내부에서는 실제 코드 변환과 메모리 최적화 등에 활용되고 있으며, 소프트웨어 개발과 업무 자동화, 사이버 방어 관련 평가에서도 높은 성능을 기록했다고 밝혔습니다.이번 글에서는 Gemini 4 Argon의 핵심 특징부터 실제 활용 사례, 성능 평가, 자율적인 사이버 방어 기능, 안전장치와 향후 제공..
Jeeves, 판단 전에 추론하는 Jev 방식의 의사결정 모델 AI가 어떤 질문에 답할 때 항상 긴 추론 과정을 거쳐야 할까요? 반대로 빠르게 선택지를 판단하는 모델은 복잡한 질문에서 정확도가 떨어질 수 있습니다. Jeeves는 이 두 가지 방식의 장점을 결합해, 판단하기 전에 필요한 만큼 추론한 뒤 선택지별 확률과 점수를 계산하도록 학습한 모델입니다.Jeeves는 Qwen3.5-9B를 기반으로 하며, Jev 방식의 의사결정 구조에 판단 전 추론 과정을 더한 것이 특징입니다. 자체 평가에서는 JevBench 공개 231문항에서 93.5%의 정확도를 기록했으며, 추론을 얼마나 수행할지 조절해 정확도와 응답 속도 사이의 균형도 맞출 수 있습니다.또한 Jev 호환 API를 통해 고객 문의의 담당 부서, 긴급 대응 필요 여부, 불만 정도와 같은 여러 판단을 한 번의 요청으..
브라우저에서 소형 LLM 7개를 직접 실행하는 MicroLLM Lab AI 모델을 사용하려면 반드시 클라우드 서버나 별도의 API가 필요하다고 생각하기 쉽습니다. 하지만 MicroLLM Lab은 이러한 방식과 달리 브라우저에서 소형 언어 모델(SLM)을 직접 실행하고, 모델의 응답 속도와 정확도를 비교할 수 있도록 구성된 실험 도구입니다.별도의 설치나 계정 없이 모델을 내려받아 브라우저에서 실행할 수 있으며, WebGPU를 이용해 사용 중인 기기의 GPU를 추론에 활용합니다. 또한 21개의 테스트와 256토큰 연속 생성 테스트를 통해 모델별 성능을 직접 확인할 수 있습니다.이 글에서는 제공된 정보를 기준으로 MicroLLM Lab의 실행 방식부터 WebGPU와 Q4, 제공 모델 7종, 벤치마크, 사용자 정의 평가 기능까지 정리합니다.브라우저에서 실행하는 소형 LLM 실험실..
agent-skills: AI 코딩 에이전트의 개발 생명주기를 구조화하는 오픈소스 스킬 모음 AI 코딩 에이전트는 코드를 빠르게 작성할 수 있지만, 실제 개발에서는 코드 작성만으로 충분하지 않습니다. 요구사항을 명확하게 정의하고 구현 방법을 계획한 뒤 테스트와 보안 검토를 거쳐 배포하는 과정까지 함께 관리해야 합니다.agent-skills는 이러한 개발 과정을 AI 코딩 에이전트가 따르도록 구조화한 오픈소스입니다. 구글 클라우드 AI 디렉터 Addy Osmani가 만든 이 프로젝트는 스펙 정의부터 계획, 구현, 테스트, 코드 리뷰, 보안 검토, 배포까지 개발 생명주기 전반을 7개 단계와 19개 스킬로 구성합니다.단순히 AI에게 코드를 작성하도록 지시하는 것이 아니라, 시니어 엔지니어 수준의 개발 워크플로우를 AI 에이전트가 따를 수 있도록 프로세스 형태로 정리한 것이 핵심입니다.AI 코딩 에이전..

728x90
반응형