본문 바로가기

728x90
반응형

전체 글

(3717)
tinyjs: JavaScript로 가벼운 네이티브 데스크톱 애플리케이션 개발하기 데스크톱 애플리케이션을 개발할 때는 사용자 인터페이스뿐 아니라 운영체제와의 연동, 실행 환경 구성, 배포 파일 생성까지 고려해야 합니다. 특히 웹 기술을 활용해 데스크톱 앱을 개발하려면 웹 렌더링 엔진과 JavaScript 실행 환경을 함께 제공해야 하므로 애플리케이션의 크기와 구성 요소가 늘어날 수 있습니다.tinyjs는 이러한 개발 환경을 간소화하기 위해 설계된 오픈소스 프로젝트입니다. HTML, CSS, JavaScript로 프런트엔드를 구성하고, JavaScript 백엔드와 네이티브 WebView를 결합해 데스크톱 애플리케이션을 개발할 수 있습니다. 프로젝트에서 제시하는 주요 특징은 약 6MB 규모의 배포 구성, Electron이나 Node.js 및 별도 Chromium 번들에 대한 비의존성, 운..
Google Cloud Gemini 에이전트란? 기업 업무 자동화부터 멀티 에이전트 오케스트레이션까지 기업의 AI 활용 방식이 단순한 질의응답을 넘어 실제 업무를 수행하는 방향으로 발전하고 있습니다. 이제 AI는 질문에 답하거나 문서를 요약하는 수준을 넘어, 기업 내부 데이터를 활용하고 여러 도구를 연결해 복잡한 작업을 계획하고 실행하는 역할을 맡기 시작했습니다.이러한 흐름에 맞춰 Google Cloud는 2026년 10월 8일, 기업 업무 전반을 지원하는 통합형 AI 에이전트인 Google Cloud Gemini 에이전트를 발표했습니다. 하나의 인터페이스와 API를 통해 지식 업무, 질문 응답, 콘텐츠 생성, 코드 작성 및 실행 등을 지원하며, 여러 AI 모델과 기업 시스템을 연계해 작업을 수행하는 것이 특징입니다.이번 글에서는 Google Cloud Gemini 에이전트의 핵심 개념과 아키텍처, 메모..
Google Research RRSI: AI 에이전트의 자기 개선을 위한 핵심 원리와 평가 방법 AI 에이전트가 더 복잡한 작업을 수행하려면 모델 자체의 성능뿐 아니라 프롬프트, 도구, 메모리, 제어 흐름 등 에이전트를 구성하는 요소도 함께 개선해야 합니다. 하지만 에이전트가 스스로 구성을 변경하도록 만들면 새로운 문제가 발생합니다. 특정 테스트에서만 좋은 결과를 내거나, 실행 비용이 지나치게 증가하거나, 평가 기준에 맞춰 결과를 왜곡할 수 있기 때문입니다.Google Research의 RRSI(Regularized Recursive Self-Improvement)는 이러한 문제를 해결하기 위해 제안된 자기 개선 방식입니다. 모델의 가중치를 직접 변경하는 대신 에이전트의 실행 환경과 구성 요소를 반복적으로 수정하고, 성능과 비용, 평가 결과의 신뢰성을 기준으로 변경 사항을 선별합니다.이번 글에서는 ..
코딩 에이전트 벤치마크: Ralph Loop 기반 AI 코딩 성능 평가와 활용 방향 AI 코딩 도구가 발전하면서 코드를 생성하는 능력뿐 아니라, 주어진 작업을 얼마나 안정적으로 완료하고 반복적인 개선을 통해 결과물의 품질을 높이는지도 중요한 평가 기준이 되고 있습니다. 특히 코딩 에이전트는 단순히 코드를 제안하는 수준을 넘어 작업을 수행하고, 실행 결과를 확인하며, 필요한 수정을 반복하는 방식으로 활용 범위를 넓히고 있습니다.이번 글에서는 Roboco의 Ralph Loop Model Benchmark 페이지를 바탕으로 코딩 에이전트 벤치마크의 목적과 Ralph Loop 방식의 의미, AI 코딩 성능을 평가할 때 살펴봐야 할 요소를 정리합니다. 다만, 현재 확인 가능한 원문 페이지에서는 본문과 세부 벤치마크 데이터가 정상적으로 추출되지 않아, 특정 모델의 점수나 순위, 실험 결과를 임의로..
Graph RAG와 일반 RAG 비교: 환각 벤치마크로 살펴보는 검색 증강 생성의 정확도와 한계 대규모 언어 모델(LLM)은 방대한 정보를 자연스러운 문장으로 생성할 수 있지만, 항상 정확한 답변을 제공하는 것은 아닙니다. 특히 여러 수치와 유사한 개체, 상충하는 정보가 함께 존재하는 환경에서는 관련 정보를 검색하더라도 잘못된 값을 선택하거나 사실과 다른 답변을 생성할 수 있습니다. 이러한 문제를 줄이기 위해 활용되는 기술이 검색 증강 생성(RAG)이며, 그중에서도 지식 그래프를 결합한 Graph RAG가 주목받고 있습니다.일반적인 벡터 기반 RAG는 질문과 의미적으로 유사한 문서를 검색해 답변 생성에 활용합니다. 반면 Graph RAG는 지식 그래프에 저장된 개체와 관계를 활용해 특정 사실을 보다 명확하게 식별하도록 설계할 수 있습니다. 그렇다면 지식 그래프를 활용하면 실제로 답변의 정확도가 높아..
Unsloth로 나만의 의사결정 모델 학습하기: LLM 파인튜닝부터 확률 기반 예측까지 대규모 언어 모델(LLM)은 일반적으로 사용자의 질문을 이해하고 자연스러운 문장을 생성하는 데 활용됩니다. 하지만 모든 업무에서 긴 답변을 생성할 필요는 없습니다. 고객 문의를 담당 부서에 분류하거나, 환불 요청 여부를 판단하거나, 주어진 조건에 따라 여러 선택지 중 하나를 결정해야 하는 상황에서는 텍스트 생성보다 정확한 선택과 판단 결과를 제공하는 기능이 더 중요할 수 있습니다.Unsloth는 이러한 요구에 맞춰 기존 LLM을 의사결정 모델(Decision Model)로 파인튜닝할 수 있는 방법을 제공합니다. 사전 학습된 모델에 의사결정에 특화된 학습 구조를 적용하고, 입력 데이터에 따라 선택지를 평가하며, 각 선택지에 대한 확률을 반환하도록 구성할 수 있습니다.이번 글에서는 Unsloth의 의사결정 ..
OpenScience: AI 에이전트로 문헌 조사부터 데이터 분석, 실험 재현까지 자동화하는 오픈소스 연구 플랫폼 과학 연구에서는 아이디어를 떠올리는 것만큼이나 문헌 조사, 데이터 정리, 분석 코드 작성, 실험 수행, 결과 검증과 보고서 작성에 많은 시간이 필요합니다. 이러한 반복 작업을 효율적으로 처리하면서도 연구 과정의 투명성과 재현성을 유지할 수 있는 방법은 무엇일까요?OpenScience는 이러한 문제를 해결하기 위해 개발된 오픈소스 AI 연구 워크벤치입니다. 사용자가 자연어로 연구 목표를 입력하면 AI 에이전트가 관련 문헌을 조사하고, 코드를 작성하고 실행하며, 실험과 데이터 분석을 수행한 뒤 결과를 정리합니다. 특히 각 단계에서 수행한 작업과 생성된 결과물을 확인할 수 있도록 설계되어 있어, 연구자가 AI의 작업을 검토하고 판단을 내릴 수 있습니다.이 글에서는 OpenScience의 핵심 개념과 주요 기능..
Gemini 3.5 Transcribe vs GPT-Transcribe 비교: 음성 인식 성능부터 API 활용까지 음성 인식 기술은 회의록 자동 작성, 실시간 자막, 고객 상담 기록 등 다양한 서비스에서 활용되고 있습니다. 최근에는 단순히 음성을 텍스트로 변환하는 것을 넘어 발언자를 구분하고, 단어별 타임스탬프를 제공하며, 여러 언어가 섞인 음성까지 처리하는 기능이 중요해지고 있습니다.이러한 환경에서 Google의 Gemini 3.5 Transcribe와 OpenAI의 GPT-Transcribe는 주목할 만한 비교 대상입니다. 두 모델은 사전 녹음된 음성을 처리하는 기능과 실시간 음성 인식 기능을 각각 제공하지만, 화자 구분, 타임스탬프, 가격, 성능 측정 결과에서는 차이를 보입니다.KDnuggets의 2026년 9월 28일자 비교 자료를 바탕으로 두 모델의 등장 배경과 주요 기능, 성능 지표, API 활용 예제를 ..
Harness-Zero: AI 에이전트의 실행 노하우를 모델에 학습시키는 기술 1. AI 에이전트의 성능은 모델만으로 결정되지 않는다AI 에이전트가 복잡한 업무를 처리할 때는 언어 모델의 성능뿐 아니라, 모델이 도구를 사용하고 작업 상태를 관리하는 방식도 중요합니다. 아무리 뛰어난 모델이라도 필요한 정보를 놓치거나, 도구를 잘못 호출하거나, 충분히 확인하지 않은 채 작업을 끝냈다고 판단하면 전체 작업의 성공률은 낮아질 수 있습니다.이러한 문제를 해결하기 위해 개발자들은 모델 외부에 다양한 실행 제어 기능을 추가해 왔습니다. 하지만 특정 업무에 최적화된 실행 환경을 계속 유지하려면 관리해야 할 코드와 설정이 늘어납니다. 여러 업무에 대응하려면 각각 다른 실행 환경을 준비해야 할 수도 있습니다.2026년 9월 공개된 연구 논문 「Harness-Zero: Harness Distillat..
TypeSafe AI Jev의 에이전트 활용 사례 20가지: 모델 라우팅부터 안전성 검증까지 AI 에이전트가 복잡한 작업을 수행하려면 단순히 답변을 생성하는 것만으로는 부족합니다. 어떤 모델을 호출할지, 도구 실행이 안전한지, 검색 결과가 질문과 관련 있는지, 작업이 정말 끝났는지를 계속 판단해야 합니다. 이러한 판단을 반복할수록 응답 속도와 비용은 물론, 시스템의 안정성도 중요해집니다.TypeSafe AI의 Jev는 이런 문제를 해결하기 위해 설계된 의사결정 모델입니다. 일반적인 생성형 AI처럼 긴 문장을 만드는 대신, 미리 정의된 선택지나 점수, 참·거짓에 대한 확률 등 구조화된 결과를 반환합니다.MarkTechPost가 소개한 20가지 활용 사례에는 모델 라우팅, 도구 실행 통제, 프롬프트 인젝션 탐지, 검색 결과 재정렬, 브라우저 자동화, 에이전트의 작업 완료 여부 검증 등이 포함됩니다...

728x90
반응형