오늘 · 8월 26일
인디해커 트렌드
AI가 매일 자동으로 정리합니다. 요약은 원문과 다를 수 있으니 링크로 원문을 확인해주세요.
GitHub Blog · 2026.08.26 06:35
프로덕션 전에 LLM을 어떻게 평가할지↗GitHub는 실제 secret scanning용 LLM을 평가하며 얻은 교훈을 정리했다. 프로덕션에 가까워질수록 깨끗한 벤치마크보다 실제 입력의 모호함, 불일치한 라벨, 잘린 문맥, 배포 분포를 반영하지 못하는 평가셋이 더 큰 문제가 되며, 성공 기준도 모델 성능이 아니라 제품 의사결정과 안전 가드레일로 정의해야 한다고 설명한다. 또한 오프라인 평가는 프롬프트·모델·입력구성·시스템 로직이 바뀔 때마다 재실행하는 통합 테스트처럼 다뤄야 하고, 각 실험은 무엇을 바꿨는지 분리해서 기록해야 한다.
혼자 LLM 기능을 붙여서 내보내는 사람에게는, ‘정확도 올리기’보다 어떤 실패를 허용할지와 배포 가능 여부를 함께 재는 평가틀이 훨씬 실전적입니다.
GitHub Changelog · 2026.08.26 05:05
GitHub Copilot 앱의 Customize 탭이 정식 출시됐다↗GitHub Copilot 앱에 Customize 탭이 정식 출시됐다. 이 탭에서는 MCP 서버, 플러그인, 스킬, 캔버스를 한곳에서 찾고, 추천 항목을 보거나 유형별로 탐색할 수 있으며, Azure DevOps의 백로그 작업 위임 같은 featured canvas도 제공한다.
Copilot을 쓰는 팀이라면 외부 도구와 워크플로를 붙여 넣는 진입점이 생긴 셈이라, 1인 개발자도 자신이 쓰는 SaaS나 내부 도구를 연결해 작업 자동화 아이디어를 시험해볼 만합니다.
Vercel Blog · 2026.08.25 13:00
Run SDK: 에이전트를 위한 안전한 실행 환경↗Vercel이 untrusted JavaScript와 TypeScript를 안전하게 실행하는 Run SDK를 공개했다. QuickJS 기반 워커에서 코드를 돌리고, 앱은 hostFunctions로만 선택한 작업을 노출하며, 인증이나 사람 승인 지점에서는 실행을 중단했다가 서명 토큰으로 재개할 수 있고, timeout과 memory limit도 설정할 수 있다.
에이전트가 실제 서비스 데이터와 맞닿는 순간 `eval`을 버리고 이런 식의 샌드박스와 호스트 함수 경계를 두면, 자동화 기능을 훨씬 덜 위험하게 제품에 얹을 수 있습니다.