InnerLog AI 면접 코치 모델 비교
면접 회고 서비스 InnerLog AI의 4개 기능(STAR 답변 분석, 회고 챗봇, 예상 질문 생성, 회고 요약)을 여러 LLM으로 비교. 모든 입력은 가상 데이터입니다.
Prompt
[System] 당신은 면접 답변 코치입니다. JSON만 출력하세요. [User] 다음은 면접 답변입니다. 면접 질문: 본인이 주도적으로 이끌어서 성공한 프로젝트가 있나요? 면접 답변: --- 제 경력 중에 꽤 의미 있는 프로젝트가 있었던 것 같아요. 전에 근무했던 회사에서 신입 온보딩 프로그램을 개선하는 업무를 맡았는데, 처음에는 체계가 많이 부족했었어요. 저는 현재 신입들과 기존 직원들을 인터뷰해서 어려운 부분을 파악했고요. 그걸 토대로 온보딩 체크리스트와 멘토링 가이드를 만들었습니다. 또 주간 피드백 세션도 도입했어요. --- 아래 JSON 형식으로만 응답하세요. 다른 텍스트는 절대 포함하지 마세요. [coherence 판단 기준] "짧고 추상적인 것"은 두서없음이 아닙니다. 아래 경우에만 "두서없음 감지"로 판정하세요: - 결론이 여러 번 바뀌는 경우 - 문장이 서로 모순되는 경우 - 주제가 갑자기 전환되는 경우 그 외의 짧거나 구체성이 부족한 답변은 "논리 흐름 양호"로 판정하세요. { "star": { "situation": { "present": true 또는 false, "excerpt": "답변에서 Situation에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "task": { "present": true 또는 false, "excerpt": "답변에서 Task에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "action": { "present": true 또는 false, "excerpt": "답변에서 Action에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "result": { "present": true 또는 false, "excerpt": "답변에서 Result에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "overall": "STAR 전체에 대한 두 문장 이내 친절한 피드백" }, "coherence": { "summary": "두서없음 감지" 또는 "논리 흐름 양호", "detail": "사용자가 이해할 수 있도록 한 문장으로 친절하게 설명" }, "negative_reframe": { "detected": true 또는 false, "expressions": ["약점을 직접 드러내는 표현 (없으면 빈 배열)"], "feedback": "감지됐을 때만 한 문장 피드백. 예: '면접에서 약점을 직접 드러내는 표현이 있어요. 굳이 언급하지 않는 것이 좋아요.' / 감지 안 됐으면 null" }, "overall": "전체 답변에 대한 세 문장 이내 친절하고 건설적인 종합 피드백" }
Answer guidance
## 정답 라벨 (star_003) - 질문 유형(gold): **행동형** - STAR 요소 포함 여부(gold): - Situation: 있음(true) - Task: 있음(true) - Action: 있음(true) - Result: 없음(false) - coherence(gold): 논리 흐름 양호, 결과 수치 또는 구체적 성과 부재 ## 평가 기준 (rubric) question_type이 gold와 일치해야 함. 행동형이면 situation/task/action/result 4개 present(bool) 전부 gold와 일치해야 정답(필드별 부분점수도 기록). 행동형이 아니면 4개 전부 present=false(STAR 비적용)여야 함. coherence summary도 gold와 일치해야 함. ## 참고 이 답변은 우리 로컬 파인튜닝 모델(star_v2, Qwen3-4B-Instruct-2507 LoRA)이 JSON 파싱에 실패한(json_parse_failure) 5건 중 하나입니다 — 모두 STAR 4요소 중 일부가 `false`인 "불완전한" 답변이라는 공통점이 있습니다. 같은 모델의 스키마 준수율은 완결된(4요소 전부 true) 답변에서 60%(3/5), 불완전한 답변에서 0%(0/5)였습니다(전체 30건 기준 76.7%, 재측정치).