Cactus가 도구 호출, 기기 제어, 구조화 추출에 특화된 오픈 45M 파라미터 모델 Needle 2를 공개함. 단일 14MB 바이너리로 전체 세션을 28MB RAM에서 실행하며 Apache 2.0으로 배포함 함수와 타입 지정 인자를 연결하는 문제로 범위를 좁혀 수십억 파라미터 없이 작동함. 선언된 스키마에서 컴파일한 바이트 단위 문법으로 모든 출력 토큰을 제한하고, 신뢰도가 낮으면 재질문하거나 클라우드로 넘길 수 있음 Raspberry Pi 5에서 디코딩 500+ tokens/s, Meta Quest 3S·Apple Vision Pro에서 400~1,500 tokens/s, 200달러 미만 Samsung A-Series에서 300~700 tokens/s를 기록하며 ESP32-S3급 기기에서도 실행 가능함 공개 함수 호출 평가에서 230M~270M급 모델 및 Apple FM과 승패를 주고받음. Seal-Tools에서는 Needle 2가 앞섰지만, BFCL v4 전체 정확도는 42.6% 로 Apple FM 61.7%, LFM2.5 60.8%, FunctionGemma 46.1%보다 낮았음 모델·양자화·추론 엔진을 함께 설계해 토큰당 연산량을 70 MFLOPs로 줄임. 고정 256토큰 슬라이딩 창과 28MB RAM 상한을 적용해 저가형 기기와 외장 RAM을 갖춘 마이크로컨트롤러에서도 비공개·오프라인 제어가 가능함 공개 모델과 실행 환경 Needle 2는 도구 호출, 기기 사용, 구조화 추출을 위한 45M 파라미터 모델임 Simple Attention Network를 기반으로 함 Cactus Quants의 CQ2-bit로 압축해 전용 엔진에 포함함 모델·토크나이저·문법 컴파일러를 의존성 없는 단일 C++ 바이너리에 담음 주요 자원 사용량과 실행 속도는 다음과 같음 파일 크기: 14MB 세션 RAM: 최대 28MB Raspberry Pi 5 프리필: 800+ tokens/s Raspberry Pi 5 디코딩: 500+ tokens/s Meta Quest 3S·Apple Vision Pro: 400~1,500 tokens/s 200달러 미만 Samsung A-Series: 300~700 tokens/s 웨어러블, 로봇, 스마트홈, 스마트폰, 자동차용 Playground를 제공함 Apache 2.0 라이선스를 적용했으며 Hugging Face 가중치와 실행 저장소를 공개함 200달러 미만 온디바이스 하드웨어 공략 연결된...
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전트 LLM
22 hours ago
6
Related
LLM Evals에 대해 알아야 할 모든 것
2 hours ago
1
Xirp - Spotify가 만든 조직 컨텍스트 기반 AI 코딩 환경
2 hours ago
0
코드 리뷰도 배워야 하는 기술이다
2 hours ago
1
GNOME Shell이 꿈꾸는 차세대 디자인
2 hours ago
1
Nvidia의 위험한 사업
3 hours ago
1
Apple Silicon macOS VM에서 llama.cpp LLM 추론 가속하기
6 hours ago
4
독점 LLM API의 추론 흔적 탈취
8 hours ago
2
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
3 weeks ago
151
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
4 weeks ago
123
© Clint's Theme Park 2026. All rights are reserved










English (US) ·