LLM 애플리케이션을 효율적으로 평가하려면 피드백을 수집하고 분석할 수 있는 강력한 도구가 필요합니다. W&B Weave는 통합 피드백 시스템을 제공하므로, 사용자는 UI에서 직접 또는 SDK를 통해 프로그래밍 방식으로 call 피드백을 제공할 수 있습니다. 이모지 반응, 텍스트 댓글, 구조화된 데이터 등 다양한 피드백 유형을 지원하므로 팀은 다음과 같은 작업을 수행할 수 있습니다:
성능 모니터링을 위한 평가 데이터셋을 구축합니다.
LLM 콘텐츠 문제를 효과적으로 파악하고 해결합니다.
파인튜닝과 같은 고급 작업에 활용할 예시를 수집합니다.
이 가이드에서는 UI와 SDK에서 Weave의 피드백 기능을 사용하는 방법, 피드백을 쿼리하고 관리하는 방법, 그리고 세부 평가를 위한 휴먼 어노테이션을 사용하는 방법을 다룹니다.
UI의 Call details panel에 있는 Use 탭에서 피드백용 SDK 사용 예시를 찾을 수 있습니다.Weave Python SDK를 사용하면 call에 대한 피드백을 프로그래밍 방식으로 추가하거나, 삭제하거나, 조회할 수 있습니다. TypeScript SDK는 현재 피드백 기능을 지원하지 않습니다.
SDK를 사용해 Weave 프로젝트의 피드백을 쿼리할 수 있습니다. SDK는 다음과 같은 피드백 쿼리 오퍼레이션을 지원합니다.
client.get_feedback(): 프로젝트의 모든 피드백을 반환합니다.
client.get_feedback("<feedback_uuid>"): <feedback_uuid>로 지정한 특정 피드백 객체를 컬렉션으로 반환합니다.
client.get_feedback(reaction="<reaction_type>"): 특정 반응 유형에 해당하는 모든 피드백 객체를 반환합니다.
client.get_feedback()에서는 각 피드백 객체에 대해 다음과 같은 추가 정보도 조회할 수 있습니다.
id: 피드백 객체 ID입니다.
created_at: 피드백 객체의 생성 시간 정보입니다.
feedback_type: 피드백 유형입니다(reaction, note, 맞춤형).
payload: 피드백 페이로드입니다.
Python
TypeScript
import weaveclient = weave.init('intro-example')# 프로젝트의 모든 피드백 조회all_feedback = client.get_feedback()# ID로 특정 피드백 객체를 가져옵니다.# API는 컬렉션을 반환하며, 여기에 포함된 항목은 최대 1개일 것으로 예상됩니다.one_feedback = client.get_feedback("<feedback_uuid>")[0]# 특정 반응 유형의 모든 피드백 객체를 찾습니다. offset과 limit를 지정할 수 있습니다.thumbs_up = client.get_feedback(reaction="👍", limit=10)# 조회 후 개별 피드백 객체의 세부 정보를 확인합니다.for f in client.get_feedback(): print(f.id) print(f.created_at) print(f.feedback_type) print(f.payload)
Call의 UUID를 사용해 Call에 피드백을 추가할 수 있습니다. UUID로 특정 Call을 조회하려면 Call 실행 중 또는 실행 후에 UUID를 조회하세요. SDK는 Call에 피드백을 추가하기 위해 다음 오퍼레이션을 지원합니다.
call.feedback.add_reaction("<reaction_type>"): 👍와 같은 지원되는 <reaction_types>(이모지) 중 하나를 추가합니다.
call.feedback.add_note("<note>"): 노트를 추가합니다.
call.feedback.add("<label>", <object>): <label>로 지정한 맞춤형 피드백 <object>를 추가합니다.
피드백 노트의 최대 글자 수는 1024자입니다. 노트가 이 제한을 초과하면 생성되지 않습니다.
Python
TypeScript
import weaveclient = weave.init('intro-example')call = client.get_call("<call_uuid>")# 이모지 반응 추가call.feedback.add_reaction("👍")# 노트 추가call.feedback.add_note("this is a note")# 맞춤형 키/값 쌍 추가# 첫 번째 인자는 사용자 정의 "type" 문자열입니다.# 피드백은 JSON으로 직렬화할 수 있어야 하며, 직렬화된 크기는 1KB 미만이어야 합니다.call.feedback.add("correctness", { "value": 5 })
다음 예제에서는 두 개의 scorer를 생성합니다. 첫 번째 scorer인 Temperature는 LLM call의 체감 온도를 평가하는 데 사용됩니다. 두 번째 scorer인 Tone은 LLM 응답의 어조를 평가하는 데 사용됩니다. 각 scorer는 연관된 객체 ID(temperature-scorer 및 tone-scorer)와 함께 save를 사용해 생성됩니다.
Python
TypeScript
import weavefrom weave.flow.annotation_spec import AnnotationSpecclient = weave.init("feedback-example")spec1 = AnnotationSpec( name="Temperature", description="The perceived temperature of the llm call", field_schema={ "type": "number", "minimum": -1, "maximum": 1, })spec2 = AnnotationSpec( name="Tone", description="The tone of the llm response", field_schema={ "type": "string", "enum": ["Aggressive", "Neutral", "Polite", "N/A"], },)weave.publish(spec1, "temperature-scorer")weave.publish(spec2, "tone-scorer")
API를 사용해 휴먼 어노테이션 스코어러 생성하기에서 이어서, 다음 예제에서는 publish 시 원래 객체 ID(temperature-scorer)를 사용해 Temperature scorer의 업데이트된 버전을 생성합니다. 그 결과 모든 버전의 이력이 포함된 업데이트된 객체가 만들어집니다.
Human annotations 아래의 Scorers 탭에서 휴먼 어노테이션 스코어러 객체의 이력을 확인할 수 있습니다.
Python
TypeScript
import weavefrom weave.flow.annotation_spec import AnnotationSpecclient = weave.init("feedback-example")# scorer의 새 버전 생성spec1 = AnnotationSpec( name="Temperature", description="The perceived temperature of the llm call", field_schema={ "type": "integer", # <<- 유형을 integer로 변경 "minimum": -1, "maximum": 1, })weave.publish(spec1, "temperature-scorer")
feedback API를 사용하면 특별한 형식의 name과 annotation_ref 필드를 지정해 휴먼 어노테이션 스코어러를 사용할 수 있습니다. annotation_spec_ref는 UI에서 적절한 탭을 선택해 획득하거나, AnnotationSpec를 생성하는 동안 획득할 수 있습니다.