제한된 로컬 하드웨어(i5, 16GB RAM, 통합 그래픽)에서 Gemma 4를 실행하기 위한 4가지 도구를 비교한 글로, 핵심은 이 도구들이 경쟁 관계가 아니라 **파이프라인 역할 분담** 구조라는 점이다. Unsloth(파인튜닝) → llama.cpp(추론 엔진) → Ollama(서빙 레이어) → LM Studio(데스크탑 UI) 순으로 각각 다른 레이어를 담당한다. 백엔드 개발자 관점에서는 로컬 AI 서빙 스택을 구성할 때 단일 도구 선택이 아니라 **각 레이어의 책임을 분리해 조합하는 아키텍처 사고**가 필요하다는 실무적 시사점을 준다.
MUFG는 ChatGPT Enterprise를 도입해 AI 네이티브 조직 구축, 업무 워크플로우 개선, 그리고 AI 기반 금융 서비스 제공을 목표로 하고 있다. 대규모 금융 기관에서의 OpenAI 엔터프라이즈 활용 사례로, 실무 워크플로우 혁신과 서비스 확장에 초점을 맞추고 있다.
Endava는 OpenAI의 Codex를 활용해 에이전틱(Agentic) 조직을 구축하고, 소프트웨어 딜리버리 속도를 높이는 데 성공했다. 특히 요구사항 분석 작업을 기존 수 주에서 수 시간으로 단축하는 성과를 거뒀다.
Percona가 창립 20주년을 맞아 리브랜딩과 함께 새로운 재단 설립을 발표했다. Percona는 오픈소스 DBaaS(Database-as-a-Service) 솔루션으로 알려진 회사다. 구체적인 기술 변경 사항은 본문에 상세히 공개되지 않았으며, 기념 행사와 조직 구조 변화가 주요 내용이다.
AWS가 관리형 검색 및 벡터 엔진을 사실상 전면 재설계(near-total rebuild)했다고 발표했다. 이번 재설계는 에이전트 워크로드(agentic workloads) 대응을 주요 목적으로 하고 있으며, OpenSearch Serverless 아키텍처가 그 대상이다. 구체적인 변경 사항은 본문에 상세히 공개되지 않았으나, 기존 아키텍처를 대폭 교체하는 수준의 변화임을 AWS가 직접 언급했다.
팬아웃(fan-out) 마이크로서비스 아키텍처에서 각 서비스의 개별 지연은 낮더라도, 느리게 완료되는 요청들이 누적되면 p99 레이턴시가 예상보다 훨씬 높아지는 **Straggler 문제**가 발생한다. 이를 해결하기 위해 **Adaptive Hedged Request** 기법을 소개하는데, DDSketch 알고리즘으로 실시간 분위수(quantile)를 추정하고, 윈도우 로테이션으로 분포 변화(drift)에 동적으로 대응한다. 추가 요청으로 인한 부하 증폭을 막기 위해 **토큰 버킷(token bucket) 예산 제한**을 함께 적용하며, 이를 통해 p99 레이턴시를 최대 74% 감소시켰다고 보고한다.