Kimi K3는 2.8조 개 매개변수와 104만 8,576토큰 컨텍스트를 갖춘 오픈 가중치 네이티브 멀티모달 에이전트 모델로, 장시간 코딩·지식 작업·추론을 지원함 Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 결합해 896개 전문가 중 토큰마다 16개를 활성화하며, Kimi K2보다 전체 스케일링 효율이 약 2.5배 높음 공개 평가에서 GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1을 기록했지만, 모델별 하네스·추론 설정·하드웨어 차이를 함께 고려해야 함 MXFP4 가중치·MXFP8 활성값으로 양자화 인식 학습됐으며 Transformers, vLLM, SGLang, Docker와 OpenAI·Anthropic 호환 API로 실행할 수 있음 다중 턴과 도구 호출에서는 API가 반환한 reasoning_content와 tool_calls를 포함한 전체 assistant 메시지를 그대로 다시 전달해야 하며, 코드와 가중치는 Kimi K3 License로 공개됨 모델 구조와 규모 Kimi K3는 장시간 코딩, 지식 작업, 추론을 위해 설계된 오픈 가중치 네이티브 멀티모달 에이전트 모델임 총 매개변수는 2.8T, 활성 매개변수는 104B이며 93개 레이어로 구성됨 Dense 레이어 1개, KDA 레이어 69개, Gated MLA 레이어 24개를 사용함 Attention hidden dimension은 7,168, attention head는 96개임 Stable LatentMoE는 896개 전문가 중 토큰마다 16개를 선택하고 공유 전문가 2개를 사용함 Latent MoE dimension은 3,584, 전문가별 MoE hidden dimension은 3,072임 Kimi K2와 비교하면 전체 스케일링 효율이 약 2.5배 향상됨 어휘 크기는 160K, 컨텍스트 길이는 1,048,576토큰이며 활성화 함수는 SiTU-GLU임 비전 인코더로 401M 매개변수의 MoonViT-V2를 사용함 주요 기능에는 텍스트·이미지·비디오 이해가 포함되지만, 모델 요약표의 modality 항목에는 Text와 Image만 기재돼 있음 장시간 코딩과 지식 작업 최소한의 사람 감독으로 긴 엔지니어링 세션을 유지하면서 대규모 저장소를 탐색하고 터미널 도구를 조율함 GPU 커널 최적화...
Hugging Face에 공개된 Kimi-K3
5 days ago
11
Related
Karpathy의 펠리컨
4 hours ago
2
실리콘밸리의 창업자 고기 분쇄기
5 hours ago
4
BMW, 구매한 차량 화면에 Spider-Man 광고 배포
6 hours ago
2
RamenHaus
7 hours ago
3
Wikimedia Foundation, 노조 인정 거부하고 노조 저지 전문 로펌 선임
8 hours ago
4
Matrix에서의 일주일
8 hours ago
3
Show HN: 엔지니어를 꿈꾸는 15살인 제가 만든 사이클로이드 감속기
9 hours ago
8
Show GN: 클로드코드 세션 탐색기 만들어 봤습니다.
9 hours ago
4
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
2 weeks ago
124
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
2 weeks ago
104
디노티시아, ICML26서 ‘STAR-KV’ 논문 발표··· ‘KV 캐시 75% 압축에도 성능 보존’
3 weeks ago
62
삼일PwC, AI 기반 '지속가능성 공시 통합 플랫폼' 출시
3 weeks ago
59
© Clint's Theme Park 2026. All rights are reserved










English (US) ·