K2 Horizon, 학습 전 과정을 공개하는 6개 AI 모델 제품군

5 hours ago 1

IFM이 0.9B부터 375B-A23B까지 6개 모델을 공개해 웨어러블과 스마트폰, 로컬 워크스테이션, 기업 서버까지 하나의 제품군으로 연결함 최종 가중치만 제공하는 데 그치지 않고 학습 데이터 또는 구축법, 코드, 설정, 중간 체크포인트, 로그와 평가 결과를 공개해 역량이 만들어지는 과정을 추적할 수 있음 자체 평가에서 0.9B, 3.7B, 7B는 각 크기 등급에서 최고 수준의 결과를 기록했으며, 추론과 수학, 코딩, 도구 사용과 에이전트 작업을 모델 크기에 맞춰 지원함 36B-A4B는 새로운 MoVA와 MoE 구조로 토큰마다 약 4B 파라미터만 활성화하면서 밀집형 32B에 가까운 성능을 냄 평가 과정에서 모델이 공개된 답안을 찾거나 채점기를 우회하는 보상 해킹까지 직접 공개했으며, 모델과 코드는 Apache 2.0으로 배포함 최종 가중치보다 학습 과정을 공개 K2 Horizon은 375B-A23B, 36B-A4B, 32B, 7B, 3.7B, 0.9B의 6개 모델로 구성됨 모델마다 다음 자료를 공개하거나 순차적으로 공개할 계획임 학습 데이터 또는 재배포가 불가능한 데이터의 출처와 구축 방법 사전학습과 후학습 코드, 모델 설정과 학습 방법 학습 단계별 중간 체크포인트와 세밀한 로그 일반 능력과 전문 작업의 평가 결과, 최종 가중치 사전학습부터 추론, 코딩, 도구 사용과 에이전트 후학습까지 이어지는 전체 개발 과정을 살펴볼 수 있음 연구자는 특정 역량이 언제 나타났는지 조사하고, 개발자는 기존 학습법을 수정해 새로운 도구와 환경에 적용할 수 있음 6개 모델은 핵심 아키텍처와 학습 방법, 인터페이스, 평가 및 배포 도구를 공유해 크기별 성능과 효율을 비교하기 쉬움 웨어러블부터 기업 서버까지 0.9B는 양자화하면 시계나 안경 같은 제약이 큰 기기에서도 실행할 수 있으며, 간단한 상호작용과 도구 사용을 대상으로 함 3.7B와 7B는 스마트폰과 온디바이스 환경에서 수학, 코딩과 여러 단계의 작업을 처리하도록 설계됨 32B는 로컬에서 실행할 수 있는 제품군 내 가장 강력한 밀집형 모델임 36B-A4B는 전체 36B 파라미터 가운데 토큰마다 약 4B만 활성화해 로컬 호스팅과 효율적인 서빙을 겨냥함 375B-A23B는 토큰마다 약 23B 파라미터를 사용하는 희소 MoE 모델로, 복잡한 추론과 소프트웨어 개발, 연구와 장기 에이전트 작업을 대상으로 함 모든 모델이 양자화를 지원하지만, 32B 등 일부 모델과 관련 자료는 아직 ...

Read Entire Article