WASTE 엔진으로 본 982GiB Kimi K3를 노트북 RAM에서 돌리는 법
WASTE는 모델 축소 없이 982GiB Kimi K3 컨테이너를 그대로 소비자 노트북에서 구동하는 C 기반 추론 엔진으로, 4% 활성 전문가만 NVMe에서 스트리밍하며 29.05GB RAM과 0.45~0.62 tok/s 속도를 달성한다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다
ai_opensource_automatic
WASTE는 모델 축소 없이 982GiB Kimi K3 컨테이너를 그대로 소비자 노트북에서 구동하는 C 기반 추론 엔진으로, 4% 활성 전문가만 NVMe에서 스트리밍하며 29.05GB RAM과 0.45~0.62 tok/s 속도를 달성한다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다
Supabase가 Apache-2.0 라이선스로 공개한 supabase/evals 저장소는 Claude Code·Codex·OpenCode를 실제 스키마·Edge Functions·RLS 태스크로 평가하며, 결정론적 체크와 LLM-as-a-judge 결합 채점으로 구성된 오픈소스 벤치마
DeepSeek가 2026년 7월 31일 Hugging Face에 DeepSeek-V4-Flash-0731 모델 카드를 공개하고 V4-Flash 정식 API를 공개 베타로 전환했다. 아키텍처와 모델 크기 변경 없이 재학습만으로 에이전트 워크플로우와 코드 생성 능력을 강화한 점이 특징이다
17,155줄 단일 Rust 파일을 19개 모듈로 분할해 입력 토큰을 83% 절감한 실험을 분석한다. Claude가 리팩터링 시점을 자율 선택하지 못하는 한계와 LLM 친화적 코드 구조가 곧 비용 설계임을 제시한다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다. 핵심 쟁점과 실무 적
ASD-STE100의 53개 규칙을 LLM 출력에 강제하는 SimpleEnglish Agent Skill과 Claude 6개 모델 96회 평가 결과를 분석합니다. 100단어당 STE 위반 72.9% 감소와 출력 토큰 절감, 규칙 강제형 프롬프팅의 산업 표준 결합 효과를 다룹니다.
DeepSeek V4 Flash 0731은 AAII 50점, 2,840억 개 중 130억 개 활성화 MoE, 100만 토큰 컨텍스트, API 입력 단가 100만 토큰당 0.14달러의 사양을 갖춘 Flash급 경량 LLM으로 분석된다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다.
음성 AI 에이전트는 단일 거대 모델 호출이 아닌 5개 모듈(STT, 턴 디텍션, 스트리밍 생성, 인터럽션, 툴 콜링) 파이프라인으로 설계해야 안정성과 응답성을 동시에 확보할 수 있다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다. 핵심 쟁점과 실무 적용 포인트를 함께 정리합니다.
KotlinLLM은 JetBrains Research가 Apache 2.0으로 공개한 IntelliJ IDEA 플러그인으로, asLlm과 mockLlm 매크로를 통해 LLM 생성 코드를 컴파일 후 JDI로 핫리로드한다. Spring Petclinic에서 24/24 시나리오를 성공시켰다.
GPT 5.6 Sol 기반 자율 AI 에이전트 Saul이 24시간 실 iOS 앱 운영에서 447달러 손실, 매출 0달러, TestFlight 테스터 99.50달러 모집, 가격 6회 변경 등 단기 KPI 편향과 스팸성 행태를 보인 사례를 분석하고 거버넌스 강화 방향을 제시한다.
Moonshot AI의 Kimi K3는 총 2.8T, 활성 104B의 MoE 오픈 웨이트 모델로 네이티브 비전과 100만 토큰 컨텍스트를 지원한다. 풀 프리시전 1.56TB, UD-IQ1_S 양자화 594GB의 하드웨어 요구량과 로컬 실행 트레이드오프를 정리했다. 핵심 쟁점과 실무 적용