내가 여전히 회의적인 이유

1 hour ago 3

환경·사회·정치적 우려에 앞서, LLM이 비자명한 소프트웨어 개발에 실제로 효과적인지조차 아직 입증되지 않았다고 봄 4년간의 ‘혁명’에도 소프트웨어의 품질·속도·비용·기능·보안은 뚜렷하게 개선되지 않았으며, 신뢰받는 오픈소스는 단순한 기능 복제만으로 대체할 수 없음 1.5조 달러가 투입됐지만 최상위 생산성 향상을 입증할 독립 연구는 거의 없고, 코드 줄 수·병합된 PR·추가 기능을 측정한 연구에서도 미미하거나 부정적인 효과가 나타남 직접 받은 LLM 생성 PR은 사람의 PR보다 병합할 가치가 있는 비율이 훨씬 낮았고, 최첨단 모델의 검사도 취미 개발자가 곧 발견한 명백하고 중요한 문제를 놓쳤음 코드량을 생산성으로 취급하면 유지보수하기 어려운 결과물이 쌓이고, 지식 노동의 동질화는 노동자의 협상력을 떨어뜨리므로 LLM 도입보다 좁은 기술 영역의 전문화를 택함 효과와 생산성에 대한 의문 4년간 LLM이 확산됐지만 소프트웨어가 더 높은 품질과 속도, 낮은 생산 비용, 향상된 기능이나 보안을 달성했다는 결과는 보이지 않음 평판 있는 조직이 채택하지 않을 저품질 데모웨어를 제외하고 실제 소프트웨어를 기준으로 평가함 기존 세력과 아이디어를 대체할 새로운 주체나 발상도 AI 낙관론 내부의 논의를 제외하면 찾기 어렵다고 봄 LLM을 사용하지 않아도 뒤처진다는 느낌이 없으며, 자신의 오픈소스 프로젝트 역시 평판 면에서 대체되지 않았음 코드를 기능적으로 복제하는 것과 사람들이 시스템의 기반으로 삼을 만큼 신뢰받는 프로젝트를 만드는 것은 다름 1.5조 달러가 투자됐지만 AI와 최상위 생산성 향상의 관계를 입증할 독립 연구는 거의 없음 많은 연구가 코드 줄 수, 병합된 PR, 추가된 기능처럼 전체 생산성과 직접 연결되지 않는 지표를 측정하거나 지나치게 작은 표본에 의존함 일정 수준의 학술적 엄밀성을 갖춘 연구에서도 생산성 향상은 미미하거나 오히려 부정적으로 나타남 코드 품질과 노동의 변화 직접 받은 LLM 생성 PR은 반복성과 문체의 획일성이 줄었지만 목적 적합성은 나아지지 않았고, 사람의 PR보다 병합할 가치가 있는 비율이 훨씬 낮았음 AI 출력이 덜 정형화되면서 사람의 작업과 구별하기 어려워지고 있음 신중한 사람도 PR 설명에 가끔 오타를 남기므로 완벽한 구별은 어려움 여러 오픈소스 라이브러리가 FAANG 기업의 의존성 트리에 포함되면서 최첨단 모델의 검사 결과를 전달받았지만, 좋은 결과보다 나쁜 결과가 많았음 모델이 놓친 명백...

Read Entire Article