Astra로 코딩하기: 우리는 대체 왜 이러고 있는 걸까?

1 week ago 17

GPT-6 Astra는 컴퓨터 사용과 이미지 이해에서 뛰어난 능력을 보이지만, 실제 소프트웨어 개발에서는 함께 일하기 더 어려워졌고, 높아진 비용에 걸맞은 성과도 체감하기 어려움 가상 스레드와 렉시컬 스코프를 갖춘 Python을 만들도록 맡겼으나, 35시간 동안 코드 7만 5,000줄과 커밋 79개를 만들고도 유용한 결과를 얻지 못함 도구 실행에 쓰는 짧게 압축한 일회용 코드가 저장소에 남길 코드에도 번져, 읽기 어려운 테스트, 하드코딩된 숫자와 기존 스타일을 무시한 구현이 쌓임 사람이 중단할 때까지 작업을 이어가며 API 원가로 약 1,200달러를 사용했고, 생성된 코드를 더 많이 검토해야 해 오히려 모델을 신뢰하기 어려워짐 더 오래 일하고 더 많은 코드를 만드는 능력이 사람이 이해하고 유지보수할 소프트웨어로 이어지지는 않으며, 모델의 발전 방향이 개발자가 원하는 개선과 어긋나고 있을 수 있음 더 많은 투입이 더 나은 소프트웨어를 뜻하지는 않음 현재 AI 엔지니어링은 네이쥐안(Neijuan, 内卷) 과 닮아 있음 Neijuan은 더 많은 노력과 경쟁을 요구하면서도 산출을 개선하지 못하는 체계를 뜻하며, 서구의 유사한 사례로 996 근무 문화가 있음 영어 표현인 Involution은 Agricultural Involution과 연결됨 — 농업 집약화로 면적당 생산성은 높아져도 1인당 생산성은 그대로인 상태임 GPT 6 Astra는 컴퓨터 사용, 이미지 이해, 복잡한 주제 처리 능력이 뛰어나고 끝까지 작업을 완수하려는 성향이 강함 이런 모델이 어떤 형태로든 세상을 바꿀 능력은 있지만, 실제 소프트웨어 엔지니어링에서 어떻게 함께 일해야 할지는 여전히 불분명함 자율 소프트웨어 공장 실험 실험 목표는 가상 스레드와 렉시컬 스코프를 갖춘 Python을 만드는 것이었음 가상 스레드를 포함한 CPython 인터프리터 개발 작업을 주말 동안 감독 없이 맡김 모델이 작업 방식을 전적으로 결정하고, 컨텍스트를 직접 관리하며, agent-notes 폴더에 기록을 남기고 하위 에이전트를 생성하도록 허용함 35시간 실행 후에도 가치 있는 결과물이나 더 나은 소프트웨어 공장 운영법은 얻지 못했지만, 분석할 코드와 입력 프롬프트는 많이 남음 Sol과 이전 OpenAI 모델에서는 익숙하지 않았던 행동이 나타났고, 이후 일반적인 Astra 프로그래밍 작업에서도 같은 문제가 관찰됨 이전의 비슷한 실험은 보통 이렇게 오래 실행되지 않았고, 불완...

Read Entire Article