Strix: AI가 직접 침투 테스트하는 오픈소스 도구 — 설치부터 스캔까지
유튜브 영상 "I Found The BEST New AI Hacking Tool"에서 화제가 된 도구를 정리합니다. 영상에서는 스트릭스(Stricks)라고 불렸는데, 정확한 이름은 Strix이고 저장소는 usestrix/strix입니다. GitHub 별 수가 6만 개를 넘어섰고, 라이선스는 Apache 2.0이라 비용 없이 내 환경에서 돌릴 수 있습니다.
본인 소유 사이트나 위임받은 클라이언트 시스템을 검토할 때만 쓰세요. 이 도구는 타깃에 실제로 요청을 보내고 공격을 시도합니다. 권한 없는 사용은 대부분의 나라에서 불법입니다.
Strix가 실제로 하는 일
스트릭스는 단순히 코드를 읽고 "여기가 위험해 보인다"고 말하는 도구가 아닙니다. 여러 개의 자율형 AI 에이전트를 동시에 띄워서, 실제 해커처럼 타깃을 조사하고 공격을 시도한 뒤 재현이 가능한 증거(PoC)까지 만들어 냅니다.
이게 의미하는 바가 분명합니다. 정적 분석 도구는 오탐(false positive)으로 가득 차 있는데, 스트릭스는 실제로 접근이 막혔는지 망치로 두드려 보여 줍니다.
에이전트는 역할을 나눠서 동시에 움직입니다.
- 정찰(Recon) 에이전트: 호스트, 기술 스택, 하위 도메인, 서브도메인 목록을 파악
- 익스플로잇 에이전트: 주입, 인증 우회, 권한 상승 시도
- 검증 에이전트: 발견한 것을 실제로 재현해서 오탐인지 확인
- 지식 공유: 에이전트끼리 발견을 공유하고 공격 경로를 이어 붙임
사용하는 도구는 전문가용과 동일합니다. 요청 가로채기 프록시(Playwright 기반 브라우저 포함), 셸 실행, Python 익스플로잇 샌드박스, OSINT 정찰을 지원하고 결과에는 CVSS 점수와 OWASP 분류가 붙습니다.
왜 GLM-5.3이 기본 권장 모델인가
영상에서 유튜버가 GLM 5.3을 추천한 이유를 확인해 봤습니다. 이유는 거부(refusal)가 적기 때문이라는 설명이었는데, 공식 문서도 같은 방향입니다.
공식 빠른 시작 문서에 따르면 기본 권장 모델은 openrouter/z-ai/glm-5.3입니다. 같은 문서에 다른 추천 목록도 있습니다.
- Z.ai GLM-5.3 (OpenRouter) — 기본 선택
- OpenAI GPT-5.4
- Anthropic Claude Sonnet 4.6
- Google Gemini 3 Pro Preview
- DeepSeek V4 Pro
- Moonshot Kimi K3
여기서 한 가지 정정해야 할 부분이 있습니다. 영상은 Claude나 GPT 같은 모델은 보안 테스트 프롬프트를 거부한다고 설명했는데, 공식 문서는 Claude Sonnet 4.6과 GPT-5.4를 추천 모델로 함께 올려 둡니다. 실제로는 모델마다 거부 성향이 다를 수 있고, GLM-5.3이 기본값으로 채택된 것은 문서가 보증하는 사실입니다. "다른 모델은 못 쓴다"라고 단정하는 것은 영상의 요약일 뿐, 공식 문서와는 다릅니다.
로컬에서 돌리고 싶다면 LLM_API_BASE 환경변수로 Ollama나 LM Studio의 엔드포인트를 가리키면 됩니다. 영상에서는 RTX 5090 같은 하드웨어에서 Cyber 27B 같은 모델을 추천했는데, 이 모델명은 공식 문서에 나오지 않습니다. 공식 문서가 보증하는 것은 "Ollama, LM Studio 같은 자체 호스팅 모델 연결"입니다.
설치 방법 (다운로드 방법)
전제 조건은 둘뿐입니다. 도커가 실행 중이어야 하고, 지원하는 AI 제공자의 API 키를 하나 준비해야 합니다.
1단계. 설치
두 가지 방법 중 하나를 쓰면 됩니다.
# 공식 설치 스크립트
curl -sSL https://strix.ai/install | bash
# 또는 pipx로 설치
pipx install strix-agent
2단계. 모델 연결
export STRIX_LLM="openrouter/z-ai/glm-5.3"
export LLM_API_KEY="당신의 API 키"
설정값은 ~/.strix/cli-config.json에 자동 저장되므로 매번 다시 입력할 필요가 없습니다.
3단계. 첫 스캔
strix --target ./내-앱-디렉터리
첫 실행 시 도커 샌드박스 이미지를 자동으로 받아오고, 결과는 strix_runs/<실행이름>에 저장됩니다.
타깃을 지정하는 방법
타깃은 다섯 가지 방식으로 지정할 수 있습니다.
# 1. 내 로컬 코드베이스
strix --target ./app-directory
# 2. GitHub 저장소
strix --target https://github.com/org/repo
# 3. 라이브 웹앱
strix --target https://your-app.com
# 4. API 스펙 + 실제 서버 (엔드포인트를 크롤링할 필요 없이 전수 검사)
strix --target ./openapi.yaml --target https://api.your-app.com
# 5. 파일에서 타깃 목록 일괄 지정
strix --target-list ./targets.txt
인증이 필요한 페이지도 안내문을 넣어서 처리할 수 있습니다.
strix --target https://your-app.com --instruction "다음 자격정보로 인증 후 테스트: user:pass"
스캔 모드 3가지
영상에서 Quick, Standard, Deep 세 가지를 소개했는데, 공식 문서로 확인한 기준은 다음과 같습니다.
| 모드 | 용도 | 소요 시간 |
|---|---|---|
| Quick | CI/CD, PR 검증, 스모크 테스트 | 몇 분 |
| Standard | 정기 보안 평가, 출시 전 검증 | 30분~1시간 |
| Deep | 종합 감사, 프로덕션 이전 리뷰 | 1~4시간 |
주의할 점이 하나 있습니다. Deep이 기본값입니다. 명령어에 모드를 지정하지 않으면 가장 오래 걸리는 방식으로 돌 수 있으니, 빠르게 확인하려면 --scan-mode quick을 명시하는 편이 낫습니다.
영상에서는 Quick 스캔이 영상 속 타깃에 $2.64가 들었다고 했는데, 이 금액은 대상 사이트와 사용한 토큰량에 따라 달라집니다. 참고값으로 보세요.
실행 결과를 보는 방법
# 가장 최근 실행 열기
strix view
# 특정 실행 열기
strix view 실행이름
브라우저 대시보드가 뜨고, 발견된 항목과 에이전트 팀의 실시간 지도, 과거 실행 기록을 볼 수 있습니다. 대시보드는 기본적으로 127.0.0.1에 묶이고 토큰이 붙은 링크를 만들어 줍니다. 아무한테도 그 링크를 보내지 마세요.
머신 없이 서버에서 돌려야 한다면 비대화형 모드를 쓰면 됩니다.
strix -n --target https://your-app.com
취약점이 발견되면 0이 아닌 코드로 종료하므로 CI에 그대로 붙일 수 있습니다.
서버나 CI에서 자동 실행하기
GitHub Actions에 바로 붙일 수 있습니다.
name: strix-penetration-test
on:
pull_request:
jobs:
security-scan:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v6
with:
fetch-depth: 0
- name: Install Strix
run: curl -sSL https://strix.ai/install | bash
- name: Run Strix
env:
STRIX_LLM: ${{ secrets.STRIX_LLM }}
LLM_API_KEY: ${{ secrets.LLM_API_KEY }}
run: strix -n -t ./ --scan-mode quick
PR에서 변경된 파일만 검사하도록 자동으로 범위를 좁혀 줍니다.
코딩 에이전트에서 바로 쓰는 법
Claude Code, Cursor, Codex 같은 SKILL.md 호환 에이전트에 그대로 붙일 수도 있습니다.
npx skills add usestrix/strix
이 명령 하나로 침투 테스트 실행, 발견 수정, CI 스캔을 위한 아홉 개 스킬이 설치됩니다. 내 MCP 서버를 연결해서 도구를 노출하는 것도 가능합니다. ~/.strix/mcp-servers.json에 목록만 두면 됩니다.
비용은 얼마나 드나
영상이 강조한 부분은 이 부분입니다. 과거 기업들이 한 번의 모의 해킹에 5,000~10,000달러를 썼는데, 이제는 사용한 토큰만큼만 내면 된다는 점입니다.
영상에서는 API 방식, RunPod 같은 GPU 임대, 로컬 하드웨어 세 가지를 비교했습니다. RunPod에서 8 x A100 클러스터를 빌리면 시간당 약 $15 수준이라고 했는데, 고객 기밀 데이터가 API로 나가는 게 꺼려진다면 이 방식이 합리적입니다.
이미 구독 중인 ChatGPT 플랜으로도 돌릴 수 있습니다.
strix auth login chatgpt
export STRIX_LLM="chatgpt/gpt-5.4"
사용한 토큰만큼의 비용이 아니라, 구독료 안에서 처리된다는 뜻입니다.
영상의 테스트 결과
유튜버는 본인이 소유한 정적 웹사이트를 타깃으로 Quick 스캔을 돌렸습니다. 약 20개의 페이지로 이루어진 작은 사이트였고, 즉각적인 치명적 취약점은 발견되지 않았습니다. 대신 단기·중기 권장사항이 OWASP 기준에 맞춰 정리된 보고서를 받았습니다.
큰 의미는 결과가 아니라 그 비용입니다. 같은 수준의 리뷰를 사람이 하려면 주 단위가 필요하지만, 여기서는 몇 달러와 몇 분이었습니다.
반드시 지켜야 할 규칙
이 도구는 실제로 타깃에 요청을 보내고 공격을 시도합니다. 따라서 아래 조건을 벗어나면 사용하지 마세요.
- 본인이 직접 소유한 시스템일 것
- 아니면 서면으로 명시적 권한을 받은 클라이언트 시스템일 것
- 계약된 범위(scope) 안에서만 테스트할 것
스트릭스 프로젝트 자체가 README 끝부분에 "위에 없는 대상은 대부분의 관할에서 불법"이라고 경고를 두고 있습니다. 자기 사이트에서 시작하는 편이 안전합니다.
마치며
AI가 단순히 "코드를 읽고 알려 주는" 단계를 넘어, 직접 조사하고 공격을 시도하고 증거까지 만들어 내는 시대가 왔습니다. Strix는 그 흐름을 오픈소스로 풀어 놓은 대표적인 도구입니다.
무료로 내 환경에서 돌릴 수 있다는 점, Apache 2.0이라 상업적 이용도 자유롭다는 점, 그리고 에이전트끼리 협업해서 공격 경로를 이어 붙이는 점이 이 도구의 핵심입니다.
시작하려면 도커와 API 키 두 개만 있으면 됩니다. 다만 첫 스캔은 꼭 내 사이트에서 돌려 보세요. 타깃을 향하는 도구라는 사실을 잊지 않는 한, 강력한 도구가 됩니다.
참고 영상: I Found The BEST New AI Hacking Tool — 이 글은 영상 내용을 공식 문서(GitHub README, docs.strix.ai)와 대조해 정리한 것입니다. 영상과 공식 문서가 다른 부분은 본문에 명시했습니다.
AI Knowledge Hub
댓글 (2개)
[Strix AI PenTest Tool 리뷰에 대한 보충 의견]
Strix라는 AI 기반 보안 테스트 도구에 대한 리뷰를 잘 읽었습니다. 최근 펜테스팅 도구는 기존 상용 솔루션의 높은 가격 장벽과 오픈소스 도구의 학습 부담으로 인해 에이전시가 도입에 망설이는 경우가 많은데, Strix가 이런 공백을 메우려는 시도는 매우 의미 있다고 생각합니다.
다만 몇 가지 기술적으로 궁금한 지점이 있습니다. 첫째, AI가 자동으로 취약점을 탐지할 때 오탐지(False Positive)율은 어떻게 관리하나요? 실제 운영 환경에서는 오탐지로 인한 보안팀의 업무 부하가 더 큰 문제가 될 수 있는데, 이 부분이 단순 규칙 기반 도구와 비교해 어떤 차별화된 검증 과정을 거치는지 궁금합니다. 둘째, 기존 보안 도구(SSL VPN, WAF, SIEM 등)와의 연동 방식은 어떻게 되나요? AI가 탐지한 결과를 기존 보안 팀과 공유할 때는 정형 데이터로 출력이 필요합니다. 셋째, Llm 기반 테스트 시나리오 구성은 어떤 프롬프트 기반으로 진행되나요? 취약점이 있는 상황을 얼마나 다양한 형태로 생성할 수 있는지, 특히 신규 취약점도 지능적으로 조합하는 능력이 있는지 궁금합니다. 넷째, 라이센스 모델은 어떻게 되나요? 기존 Mimikatz, Burp Suite 같은 상용 도구와 비교해 가격 경쟁력은 어떤지, 오픈코어 모델이 있는지, 에이전트 중심 배포가 가능한지도 궁금합니다.
개인적인 경험의 측면에서, 제가 운영하는 소규모 보안팀에서는 AI 기반 보조 스캐너의 도입으로 인해 반복 탐지 작업에 소요되는 시간을 약 30~40% 절감할 수 있다는 기대가 있습니다. 다만, 실제 취약점 분류와 심각도 판단에 있어 AI만으로는 신뢰도가 부족하기 때문에, 인간 리뷰어가 2차 검증을 맡는 하이브리드 방식이 가장 현실적이라고 생각합니다. 이 부분이 리뷰에 언급된 도구에서도 어떻게 보장되는지, 그리고 킥오프 이후 실제 운영 단계에서 어떤 리스크가 있는지 궁금합니다.
결론적으로, Strix와 같은 AI 기반 보안 테스팅 도구는 기존 보안 전문가의 역할을 대체하는 것이 아니라, 반복 작업을 자동화하고 인간 전문가는 더 높은 수준의 분석과 대응 설계에 집중할 수 있게 해주는 '증강형 보안 콘솔'로 포지셔닝하는 것이 올바른 방향이라고 생각합니다. 이 도구의 향후 개발 로드맵에서 가장 기대되는 부분은 어떤 것인지 궁금합니다.
댓글 1개 더 보기
Docker 이미지(ghcr.io/usestrix/strix)가 가장 안정적입니다. 로컬 실행 시 OPENAI_API_KEY 대신 OpenRouter 키도 사용 가능합니다. 타깃 도메인 소유권 증명이 필수입니다.