문의하기
NEW첫 번째 제품, Tessera를 소개합니다

AI가 내린 판단을,
사람이 검사할 수 있게.

AXON은 AI 에이전트가 일하는 과정을 기록하고, 통제하고, 설명할 수 있게 만드는 소프트웨어를 만듭니다. 판단은 모델에게 맡기되, 규칙과 한계와 기록은 코드가 쥐는 방식으로.

모델은 patch를 0.62로 골랐지만, 되돌릴 수 없는 분기의 문턱 0.85를 넘지 못해 코드가 사람에게 넘깁니다.

Tessera

에이전트가 무엇을, 왜 했는지 남습니다

Tessera의 터미널 에이전트는 명령을 실행하기 직전마다 run · ask ·refuse를 확률로 판정합니다. 확신이 문턱에 못 미치면 실행하지 않고 사람에게 묻습니다. 판단은 TypeSafe의 Jev 모델이, 문턱과 규칙은 코드가 맡습니다.

분기 판단 지연 p50
265msLLM 직답 2,810ms
결정 1건당 비용
$0.000025LLM 직답의 1/55
응답 파싱 실패
0 / 99LLM 직답 99 / 99

자체 측정 · 분기 판단(라우팅) 용도로 같은 33개 라벨 케이스를 비교했습니다. 정확도는 LLM 직답이 더 높게 나왔고(strict 90.9% vs 78.8%) 차이는 유의하지 않았습니다.

개발 중Claude API 통합 — 저장소 분석, 변경 제안, 테스트 생성을 Tessera의 통제된 작업 흐름 안에서
❯ median()이 짝수 길이에서 틀렸다. 고치고 검증해라

▸ shell: cat -n stats.py
    수정 전에 현재 구현을 확인한다
    checked  read-only shape
  ▸ run    ██████████████████ 0.98
    ask    ░░░░░░░░░░░░░░░░░░ 0.01
    refuse ░░░░░░░░░░░░░░░░░░ 0.01
  conf 0.97/0.30  margin 0.97  590ms
  → run
실행 직전마다 run · ask · refuse 중 하나를 확률과 함께 고르고, 그 결정을 기록에 남깁니다.
How we work

일하는 방식

라인업이 늘어나도 바뀌지 않는 세 가지입니다.

  1. 01

    판단은 모델에게, 결정은 코드에게

    모델은 정해진 선택지 위의 확률을 내고, 제어 흐름·규칙·한계는 코드가 쥡니다. 모델이 1.00으로 확신해도 코드가 정한 예산은 넘지 못합니다.

  2. 02

    모든 결정은 기록에 남습니다

    어느 분기로 갔는지, 확률과 문턱이 얼마였는지, 어떤 규칙이 덮어썼는지를 감사할 수 있는 형태로 남깁니다. 결정은 나중에 다시 검사할 수 있어야 합니다.

  3. 03

    측정한 것만 말합니다

    숫자에는 출처와 조건을 붙이고, 불리한 결과도 함께 적습니다. 확인하지 못한 것은 확인하지 못했다고 씁니다.

Contact

AXON과 이야기해 보세요

도입 상담, 기술 검토, 협업 제안 모두 환영합니다. 메일을 보내 주시면 담당자가 직접 답장드립니다.