All MicroEvals
InnerLog AI 면접 코치 모델 비교
Create MicroEval

InnerLog AI 면접 코치 모델 비교

면접 회고 서비스 InnerLog AI의 4개 기능(STAR 답변 분석, 회고 챗봇, 예상 질문 생성, 회고 요약)을 여러 LLM으로 비교. 모든 입력은 가상 데이터입니다.

Prompt

[System] 당신은 면접 답변 코치입니다. JSON만 출력하세요. [User] 다음은 면접 답변입니다. 면접 질문: 본인이 주도적으로 이끌어서 성공한 프로젝트가 있나요? 면접 답변: --- 제 경력 중에 꽤 의미 있는 프로젝트가 있었던 것 같아요. 전에 근무했던 회사에서 신입 온보딩 프로그램을 개선하는 업무를 맡았는데, 처음에는 체계가 많이 부족했었어요. 저는 현재 신입들과 기존 직원들을 인터뷰해서 어려운 부분을 파악했고요. 그걸 토대로 온보딩 체크리스트와 멘토링 가이드를 만들었습니다. 또 주간 피드백 세션도 도입했어요. --- 아래 JSON 형식으로만 응답하세요. 다른 텍스트는 절대 포함하지 마세요. [coherence 판단 기준] "짧고 추상적인 것"은 두서없음이 아닙니다. 아래 경우에만 "두서없음 감지"로 판정하세요: - 결론이 여러 번 바뀌는 경우 - 문장이 서로 모순되는 경우 - 주제가 갑자기 전환되는 경우 그 외의 짧거나 구체성이 부족한 답변은 "논리 흐름 양호"로 판정하세요. { "star": { "situation": { "present": true 또는 false, "excerpt": "답변에서 Situation에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "task": { "present": true 또는 false, "excerpt": "답변에서 Task에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "action": { "present": true 또는 false, "excerpt": "답변에서 Action에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "result": { "present": true 또는 false, "excerpt": "답변에서 Result에 해당하는 문장 발췌 (없으면 null)", "comment": "사용자에게 친절하게 설명하는 한 문장 피드백" }, "overall": "STAR 전체에 대한 두 문장 이내 친절한 피드백" }, "coherence": { "summary": "두서없음 감지" 또는 "논리 흐름 양호", "detail": "사용자가 이해할 수 있도록 한 문장으로 친절하게 설명" }, "negative_reframe": { "detected": true 또는 false, "expressions": ["약점을 직접 드러내는 표현 (없으면 빈 배열)"], "feedback": "감지됐을 때만 한 문장 피드백. 예: '면접에서 약점을 직접 드러내는 표현이 있어요. 굳이 언급하지 않는 것이 좋아요.' / 감지 안 됐으면 null" }, "overall": "전체 답변에 대한 세 문장 이내 친절하고 건설적인 종합 피드백" }

Answer guidance

## 정답 라벨 (star_003) - 질문 유형(gold): **행동형** - STAR 요소 포함 여부(gold): - Situation: 있음(true) - Task: 있음(true) - Action: 있음(true) - Result: 없음(false) - coherence(gold): 논리 흐름 양호, 결과 수치 또는 구체적 성과 부재 ## 평가 기준 (rubric) question_type이 gold와 일치해야 함. 행동형이면 situation/task/action/result 4개 present(bool) 전부 gold와 일치해야 정답(필드별 부분점수도 기록). 행동형이 아니면 4개 전부 present=false(STAR 비적용)여야 함. coherence summary도 gold와 일치해야 함. ## 참고 이 답변은 우리 로컬 파인튜닝 모델(star_v2, Qwen3-4B-Instruct-2507 LoRA)이 JSON 파싱에 실패한(json_parse_failure) 5건 중 하나입니다 — 모두 STAR 4요소 중 일부가 `false`인 "불완전한" 답변이라는 공통점이 있습니다. 같은 모델의 스키마 준수율은 완결된(4요소 전부 true) 답변에서 60%(3/5), 불완전한 답변에서 0%(0/5)였습니다(전체 30건 기준 76.7%, 재측정치).

No responses available for this prompt yet