Perplexity AI의 WANDR가 정의하는 리서치 에이전트 평가 기준과 한계
Perplexity AI가 공개한 오픈 벤치마크 WANDR는 500개 증거 중심 태스크로 리서치 에이전트의 인용 능력을 평가하며, Perplexity Search as Code가 soft F1 0.363, hard F1 0.133을 기록했다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합
ai_opensource_automatic
Perplexity AI가 공개한 오픈 벤치마크 WANDR는 500개 증거 중심 태스크로 리서치 에이전트의 인용 능력을 평가하며, Perplexity Search as Code가 soft F1 0.363, hard F1 0.133을 기록했다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합
LLM 생성 코드를 사람 검토만으로 품질 보장하기 어렵다는 주장을 400 LOC 상한, 결함 탐지율 데이터, 역설적 확신 패턴으로 분해해 운영·인지적 한계와 현실적 대안을 정리한 비판적 분석 글. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다. 핵심 쟁점과 실무 적용 포인트를 함께 정
Kimi K3, DeepSeek V4 Pro, GLM-5.2 공개형 1조 스케일 MoE 모델 3종을 measured intelligence 점수, MIT와 Modified MIT 라이선스 구분, 실제 서빙 비용 축에서 비교한 MarkTechPost 기사를 정리한 분석 글입니다.
Stack Overflow 트래픽 약 14% 감소와 Overflow AI 발표를 중심으로 생성형 AI가 개발자 Q&A 생태계에 미친 영향을 data.stackexchange.com 지표와 사업 전략 다변화 측면에서 분석한다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다.
1976년 7월 출시된 Zilog Z80이 2026년 7월로 정확히 50주년을 맞이했다. 8080 호환성, 단일 5V 전원, MREQ·IORQ 제어, 내장 DRAM 리프레시, LR35902와 eZ80 같은 후손 칩, 그리고 레트로 컴퓨팅 생태계까지 Z80의 설계 철학과 현재까지의 영향력
Google Cloud의 Always-On Memory Agent 참조 구현을 분석한 글. Gemini 3.1 Flash-Lite와 Google ADK로 벡터 DB와 임베딩 없이 SQLite 기반 메모리를 24/7 연속 통합하는 멀티 에이전트 구조와 RAG 대비 비용·지연 개선 효과를
Claude Code 2.1.198에서 AskUserQuestion 60초 무응답 시 모델이 작업을 자체 진행하는 자동 진행 기능이 기본값으로 활성화된 사례를 분석하고, 2.1.200 패치의 한계와 에이전틱 AI 거버넌스 논의를 정리한 글. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니
앤트로픽이 2026년 7월 20일부터 클로드 페이블 5를 Max와 Team Premium 요금제 기본 한도의 50%까지 별도 크레딧 없이 제공하고, Pro와 Team Standard에는 1회성 100달러 크레딧을 지급한다고 공식 발표했다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다
2026년 중반 오픈 웨이트 LLM이 코딩·지시 이행·일반 지식에서 폐쇄형과 비슷한 성능을 보이고, 36개월간 추론 비용이 50배 하락하며 OpenRouter 토큰 점유율 반전까지 일어난 임계점을 분석하고 자가 호스팅·라우팅·에이전트 하네스 전략 함의를 다룬다. 핵심 쟁점과 실무 적용
Zyphra가 2026년 7월 16일 Apache 2.0 라이선스로 공개한 EEG 파운데이션 모델 ZUNA1.1은 380M 파라미터 masked diffusion autoencoder 구조와 0.5~30초 가변 길이 입력을 지원해 scalp-EEG의 재구성·디노이징·업샘플링 성능을 확보