확증 편향이 디버깅을 망치는 이유와 끊는 법
도구가 300초씩 멈추는 버그를 두 번이나 엉뚱한 원인으로 오판했다. 권한 플래그와 모델 티어를 차례로 의심했지만 진짜 원인은 하위 프로세스에 전달하지 않은 표준 입력이었다.
카테고리
도구가 300초씩 멈추는 버그를 두 번이나 엉뚱한 원인으로 오판했다. 권한 플래그와 모델 티어를 차례로 의심했지만 진짜 원인은 하위 프로세스에 전달하지 않은 표준 입력이었다.
AI 코딩 에이전트를 쓸 때 이 작업을 직접 처리할지 서브에이전트에 위임할지 가르는 네 가지 신호와 비용 교차점, 실제 판정 사례를 정리했다.
AI 에이전트의 도구는 함수가 아니다. 스키마·프롬프트·실행·UI로그·기능 게이트라는 다섯 계약을 공개 동작을 관찰해 정리한 도구 설계 체크리스트. 권한 판단은 별도 글로 넘긴다.
AI로 애드센스 글을 쓸 때 가짜 수치·경험을 지어내면 왜 위험한지, 한국어 어미 단조는 끝 어절로 봐야 하는 이유, 발행 전 다섯 단계 검증 게이트를 정리한다.
검증 결과 파일에 적힌 모델 이름과 실제로 호출된 모델이 다를 수 있다. 잘못된 슬러그가 조용히 다른 모델로 대체된 사례로 표시명 대신 실행 로그를 확인하는 법을 정리했다.
AI 코딩 에이전트 비용이 새는 이유는 호출 가격이 아니라 예산창·귀속·예외 워크플로우 설계 부재다. LangChain의 LLM Gateway 사례로 실전 비용 통제 프레임워크를 정리한다.
LLM 답변이 흐릿하다면 모델보다 질문 구조를 먼저 봐야 한다. 관점, 절단면, 숫자를 넣어 바로 쓸 답을 끌어내는 방법.
원자료가 5,000개를 넘어가면 전부 다시 읽을 수 없다. raw는 원문 창고로, wiki는 LLM이 압축해 다시 쓰는 지도로 나누자 검색이 되살아났다.
AI가 쓴 코드를 같은 모델로 검토하면 자기 실수를 놓친다. 작성자와 다른 벤더가 계획·테스트·구현을 단계마다 교차 검증하고, 근거가 비면 통과 대신 실패로 처리한다.
AI 에이전트에게 작업을 맡기기 전, 프롬프트 문장보다 먼저 정해야 할 건 계약 구조다. 목표·문맥·범위·제약·검증·인계 6가지와 위임 4단계를 실전 프레임워크로 정리했다.
1년 넘게 Claude Code를 쓰는 개발자가 미니멀 하네스 Pi를 항목별로 비교한다. 흉내 낼 수 있는 부분과 구조적으로 안 되는 부분을 가르고, 여전히 Claude Code Max 20을 쓰는 이유를 적는다.