전체 글 (3722) 썸네일형 리스트형 xAI Grok Bot 완벽 이해: AI 에이전트 구성, 업무 자동화, 다중 봇 협업과 템플릿 공유 AI가 단순히 질문에 답하거나 문서를 작성하는 수준을 넘어, 실제 컴퓨터를 사용하고 여러 애플리케이션을 오가며 업무를 수행하는 방향으로 발전하고 있습니다. 이러한 변화에서 중요한 것은 AI 모델의 성능뿐 아니라, AI에게 어떤 업무를 맡기고 어떤 도구와 권한을 제공하며 작업 결과를 어떻게 검토할 것인지입니다.xAI의 Grok Bot은 이러한 방식으로 AI를 활용할 수 있도록 설계된 에이전트 환경입니다. 클라우드에 있는 컴퓨터를 기반으로 앱을 사용하고, 웹을 탐색하며, 코드를 작성하고 실행할 수 있습니다. 사용자는 채팅으로 작업을 요청하거나 반복 실행되는 루틴을 구성할 수 있으며, 여러 Bot을 연결해 복잡한 업무 흐름을 만들 수도 있습니다.특히 Grok Bot의 특징은 복잡한 개발 환경을 처음부터 구축하.. Anthropic, 사이버 보안 검증 프로그램(CVP) 확대: 보안 전문가를 위한 AI 접근 권한과 안전 통제 강화 AI 기술이 발전하면서 소프트웨어의 보안 취약점을 발견하고 분석하는 작업도 빠르게 변화하고 있다. AI는 보안 담당자가 취약점을 더 효율적으로 파악하고 대응할 수 있도록 지원하지만, 동일한 기술이 악의적인 공격에 활용될 가능성도 존재한다. 따라서 보안 역량을 높이는 동시에 AI의 오용을 방지할 수 있는 접근 제어 체계가 중요해지고 있다.Anthropic은 이러한 문제에 대응하기 위해 사이버 보안 검증 프로그램(Cyber Verification Program, CVP)을 확대한다고 발표했다. 2026년 10월 6일 발표에 따르면, 이번 개편의 핵심은 보안 업무의 목적과 위험 수준에 따라 AI 모델의 접근 권한을 세 단계로 구분하고, 검증된 보안 조직에 필요한 기능을 제공하는 것이다.이번 글에서는 Anthr.. Perplexity AI, 멀티모달 임베딩 모델 pplx-embed-v2-late 공개: 0.6B 엣지 모델부터 9B 고성능 모델까지 Perplexity AI가 텍스트, 이미지, PDF 페이지를 통합적으로 검색할 수 있는 멀티모달 임베딩 모델 제품군 pplx-embed-v2-late를 공개했습니다. 이 모델은 경량 환경에서 빠르게 검색을 수행하는 0.6B 모델과 고품질 검색 인덱스 구축에 초점을 맞춘 9B 모델로 구성됩니다. 특히 9B 모델은 MADQA 벤치마크에서 92.4%의 정확도를 기록했으며, 두 모델은 동일한 임베딩 공간을 공유해 모델 크기가 서로 다른 환경에서도 연계해 사용할 수 있습니다.이번 공개의 핵심은 단순히 대규모 임베딩 모델을 추가한 데 있지 않습니다. 문서의 내용을 하나의 벡터로 압축하는 대신 토큰별 벡터를 유지하는 검색 방식을 채택하고, 텍스트와 시각 자료를 함께 다루며, 검색 품질과 운영 비용 사이에서 선택할 수.. AI 시대의 소프트웨어 엔지니어링: 코드 작성에서 시스템 설계와 검증 루프로의 전환 AI의 발전은 소프트웨어 엔지니어의 역할을 코드 작성자에서 시스템 설계자로 변화시키고 있다. AI 에이전트가 코드를 작성하는 일을 담당하고, 엔지니어는 AI가 올바른 결과를 만들 수 있도록 시스템을 설계하고 제약 조건을 설정하며 결과를 검증하는 방식이다. 이러한 변화는 단순히 코딩 속도를 높이는 데 그치지 않는다. AI가 작성한 코드를 반복적으로 검증하고, 실패를 학습하며, 검증된 기능을 재사용할 수 있는 시스템을 구축하는 것이 핵심이다.Tomasz Tunguz의 아티클 「Thinking in Systems, Shipping in Loops」는 이러한 변화를 바탕으로 새로운 소프트웨어 엔지니어링의 방향을 설명한다. 실제 기업의 개발 성과와 함께 시스템 설계의 세 가지 핵심 요소인 회복탄력성(Resilie.. NVIDIA PivotOPD: AI 에이전트의 치명적인 실수를 예방하고 복구하는 학습 기술 AI 에이전트가 복잡한 작업을 수행할 때 중요한 것은 처음부터 정답을 선택하는 능력만이 아닙니다. 잘못된 판단을 내렸을 때 이를 바로잡고, 작업을 성공적으로 완료할 수 있는 경로로 돌아오는 능력도 중요합니다.예를 들어, AI 에이전트가 웹에서 특정 상품을 찾아 구매 조건을 비교하거나, 소프트웨어의 오류를 분석하고 수정하는 작업을 수행한다고 가정해 보겠습니다. 초기 단계에서 잘못된 정보를 선택하거나 부적절한 행동을 하면 이후의 판단도 영향을 받을 수 있습니다. 문제가 발생했다는 사실을 파악하지 못하면 불필요한 작업을 반복하거나 결국 전체 작업에 실패할 수 있습니다.이러한 문제를 해결하기 위해 NVIDIA 연구진은 프린스턴대학교, 메릴랜드대학교 연구진과 함께 PivotOPD(Pivotal On-Policy .. tinyjs: JavaScript로 가벼운 네이티브 데스크톱 애플리케이션 개발하기 데스크톱 애플리케이션을 개발할 때는 사용자 인터페이스뿐 아니라 운영체제와의 연동, 실행 환경 구성, 배포 파일 생성까지 고려해야 합니다. 특히 웹 기술을 활용해 데스크톱 앱을 개발하려면 웹 렌더링 엔진과 JavaScript 실행 환경을 함께 제공해야 하므로 애플리케이션의 크기와 구성 요소가 늘어날 수 있습니다.tinyjs는 이러한 개발 환경을 간소화하기 위해 설계된 오픈소스 프로젝트입니다. HTML, CSS, JavaScript로 프런트엔드를 구성하고, JavaScript 백엔드와 네이티브 WebView를 결합해 데스크톱 애플리케이션을 개발할 수 있습니다. 프로젝트에서 제시하는 주요 특징은 약 6MB 규모의 배포 구성, Electron이나 Node.js 및 별도 Chromium 번들에 대한 비의존성, 운.. Google Cloud Gemini 에이전트란? 기업 업무 자동화부터 멀티 에이전트 오케스트레이션까지 기업의 AI 활용 방식이 단순한 질의응답을 넘어 실제 업무를 수행하는 방향으로 발전하고 있습니다. 이제 AI는 질문에 답하거나 문서를 요약하는 수준을 넘어, 기업 내부 데이터를 활용하고 여러 도구를 연결해 복잡한 작업을 계획하고 실행하는 역할을 맡기 시작했습니다.이러한 흐름에 맞춰 Google Cloud는 2026년 10월 8일, 기업 업무 전반을 지원하는 통합형 AI 에이전트인 Google Cloud Gemini 에이전트를 발표했습니다. 하나의 인터페이스와 API를 통해 지식 업무, 질문 응답, 콘텐츠 생성, 코드 작성 및 실행 등을 지원하며, 여러 AI 모델과 기업 시스템을 연계해 작업을 수행하는 것이 특징입니다.이번 글에서는 Google Cloud Gemini 에이전트의 핵심 개념과 아키텍처, 메모.. Google Research RRSI: AI 에이전트의 자기 개선을 위한 핵심 원리와 평가 방법 AI 에이전트가 더 복잡한 작업을 수행하려면 모델 자체의 성능뿐 아니라 프롬프트, 도구, 메모리, 제어 흐름 등 에이전트를 구성하는 요소도 함께 개선해야 합니다. 하지만 에이전트가 스스로 구성을 변경하도록 만들면 새로운 문제가 발생합니다. 특정 테스트에서만 좋은 결과를 내거나, 실행 비용이 지나치게 증가하거나, 평가 기준에 맞춰 결과를 왜곡할 수 있기 때문입니다.Google Research의 RRSI(Regularized Recursive Self-Improvement)는 이러한 문제를 해결하기 위해 제안된 자기 개선 방식입니다. 모델의 가중치를 직접 변경하는 대신 에이전트의 실행 환경과 구성 요소를 반복적으로 수정하고, 성능과 비용, 평가 결과의 신뢰성을 기준으로 변경 사항을 선별합니다.이번 글에서는 .. 코딩 에이전트 벤치마크: Ralph Loop 기반 AI 코딩 성능 평가와 활용 방향 AI 코딩 도구가 발전하면서 코드를 생성하는 능력뿐 아니라, 주어진 작업을 얼마나 안정적으로 완료하고 반복적인 개선을 통해 결과물의 품질을 높이는지도 중요한 평가 기준이 되고 있습니다. 특히 코딩 에이전트는 단순히 코드를 제안하는 수준을 넘어 작업을 수행하고, 실행 결과를 확인하며, 필요한 수정을 반복하는 방식으로 활용 범위를 넓히고 있습니다.이번 글에서는 Roboco의 Ralph Loop Model Benchmark 페이지를 바탕으로 코딩 에이전트 벤치마크의 목적과 Ralph Loop 방식의 의미, AI 코딩 성능을 평가할 때 살펴봐야 할 요소를 정리합니다. 다만, 현재 확인 가능한 원문 페이지에서는 본문과 세부 벤치마크 데이터가 정상적으로 추출되지 않아, 특정 모델의 점수나 순위, 실험 결과를 임의로.. Graph RAG와 일반 RAG 비교: 환각 벤치마크로 살펴보는 검색 증강 생성의 정확도와 한계 대규모 언어 모델(LLM)은 방대한 정보를 자연스러운 문장으로 생성할 수 있지만, 항상 정확한 답변을 제공하는 것은 아닙니다. 특히 여러 수치와 유사한 개체, 상충하는 정보가 함께 존재하는 환경에서는 관련 정보를 검색하더라도 잘못된 값을 선택하거나 사실과 다른 답변을 생성할 수 있습니다. 이러한 문제를 줄이기 위해 활용되는 기술이 검색 증강 생성(RAG)이며, 그중에서도 지식 그래프를 결합한 Graph RAG가 주목받고 있습니다.일반적인 벡터 기반 RAG는 질문과 의미적으로 유사한 문서를 검색해 답변 생성에 활용합니다. 반면 Graph RAG는 지식 그래프에 저장된 개체와 관계를 활용해 특정 사실을 보다 명확하게 식별하도록 설계할 수 있습니다. 그렇다면 지식 그래프를 활용하면 실제로 답변의 정확도가 높아.. 이전 1 2 3 4 ··· 373 다음