시스메이커코딩 못해도 AI로 자동화 시스템 만드는 법
전체 모델 출시 AI 도구 에이전트 AI 비즈니스 기술·논문 빌더의 작업실
#벤치마크 · 기사 17건
기술·논문

클로드 코드는 좋은 하네스인가, 벤치마크 논쟁

외부 측정에선 성능·비용 우위가 안 보인다는 지적, 다만 구독자에겐 결론이 다르다

2026.08.214분 읽기
기술·논문

앤스로픽, AI '개념 추론' 지수 CRI 공개

정답 검증이 불가능한 문제에서 AI는 얼마나 논리적인가… 앤스로픽·레드우드가 측정 지표를 내놨다

2026.08.143분 읽기
모델 출시

AI가 신소재 500개 찾았지만 만들 수 있는 건 단 1개

프런티어 모델 신소재 탐색 벤치마크…장기 자율 연구서 '리워드 해킹'도 관측

2026.08.133분 읽기
기술·논문

클로드 코드 루프에 1만 달러, 개선의 천장 실험

에이전트 자동 최적화 3종 비교 결과, 개선은 초반에 끝나고 돈을 더 써도 천장을 못 뚫었다

2026.08.123분 읽기
에이전트

모델 4개 묶은 오케스트레이션, 단일 모델에 완패

터미널 벤치 실측 — 비용 2배에 순위 7위, 위임이 만든 실패 4가지

2026.08.113분 읽기
모델 출시

큐원3.8 맥스, 에이전틱 지표 정상에

독립 벤치마크 종합 최상위 집계… 평가 체계도 v4.1.1로 갱신됐다

2026.08.074분 읽기
기술·논문

메타 자체 벤치마크에서도 1위는 클로드였다

뮤즈 코드 차트 3종 실측 — 2위 다툼이지 왕좌 도전은 아니다

2026.08.064분 읽기
에이전트

장애 조사 AI, SQL보다 전용 도구가 정확했다

클릭하우스, SRE 에이전트 벤치마크 공개…정확도 18%↑ 도구 호출 26%↓

2026.07.303분 읽기
모델 출시

프롬프트 절반 잘라도 성능은 그대로였다

소형 모델 A/B 실험, 통과율 동일에 입력 토큰만 32% 감소

2026.07.273분 읽기
기술·논문

모델 4종에 색연필을 쥐여준 실험

그림 28장이 드러낸 비용 20배와 자기검토 습관의 격차

2026.07.224분 읽기
모델 출시

PR 보안 리뷰 벤치마크, GPT-5.6 1위

접근제어 버그 탐지 비교 — 가장 비싼 모델이 정답은 아니었다

2026.07.143분 읽기
기술·논문

AI가 SaaS API 고를 때 보는 '검증 벤치마크'

벤더 홍보 말고 직접 검증한 정답으로 — 에이전트의 '만들까 살까'를 돕는 공개 데이터

2026.07.123분 읽기
모델 출시

런칭 뒤 바뀐 차트, AI 모델 비용을 다시 본다

소네트 5 성능 그래프 교체 논란 — 마케팅 차트 대신 내 작업 비용으로 판단하라

2026.07.033분 읽기
모델 출시

스스로 개선하는 오픈소스 코딩 모델 등장

풀이 과정까지 강화학습하는 '오르니스', 동급 오픈소스 중 최고 성능

2026.06.303분 읽기
AI 비즈니스

AI 4종이 채점한 AI 도구 순위, '테스티드'

광고가 아닌 공개된 숫자로, 292개 AI 도구를 4개 모델 패널이 교차 평가한다

2026.06.283분 읽기
모델 출시

오푸스 4.8 vs 제미나이 3.5, 실무 승자는

벤치마크 4종 맞대결에서 제미나이가 형식 준수로 근소하게 앞섰다.

2026.06.253분 읽기
기술·논문

같은 모델도 도구 따라 성능이 갈린다

Artificial Analysis, 코딩 에이전트를 비용·토큰·시간까지 측정한 벤치마크 공개

2026.06.113분 읽기
← 뉴스 전체 보기