빌런 TOP 20
일간 l 주간 l 월간
1
[컴퓨터] 서린씨앤아이, 리안리 커브드 OLED 디스플레이 적용 수랭 쿨러 하이드로시프트 II 시리즈 출시
2
[인공지능] 엔비디아, 에이전트 툴킷으로 DGX 스테이션에서 개인용 AI 에이전트 간소화
3
[모바일] 삼성전자, 갤럭시 Z 폴드8 울트라·폴드8·플립8 등 폴더블 3종 라인업으로 확대
4
[이슈/논란] 구독형은 이제 끝?
5
[수컷학개론] 연기 없다고 안전한가, 전자담배가 남긴 폐 손상 신호
6
[후방/은꼴] 기래민 돌핀팬츠
7
[음악] 킹넷, ‘열혈강호: 넥스트’ 두 번째 OST에 송가인 참여… 29일 게임 출시와 함께 음원 공개
8
[카메라] 니콘이미징코리아, 전시회 기획부터 포트폴리오 제작까지… 8월 니콘스쿨 커리큘럼 공개
9
[일상/생활] 일본 버블 온천 폐허, 부곡하와이 부활 기대
10
[컴퓨터] 이엠텍, AI 인프라 시장 겨냥 '레드빗 4U 서버 케이스 3종' 최신 CPU 쿨러 호환성 데이터 공개
11
[컴퓨터] 서린컴퓨터, 리안리 A3 데스크테리어 미니 PC 2종 출시
12
[일상/생활] 40대 전기기능사 실기 합격기
13
[모바일] 케이스티파이, 갤럭시 Z8 시리즈 케이스 라인업 공개
14
[이슈/논란] 미국이 그린란드를 먹으려는 이유는?
15
[모바일] 한발 앞서 만나보는 차세대 폴더블, 새로운 갤럭시 Z 시리즈
16
[일상/생활] 시험 중 휴대폰 영장 요구, 로스쿨생 실망
17
[일상/생활] 우리나라 오래된 빵집 20곳 정리
18
[일상/생활] 딸 위해 햄버거 사준 70대 엄마
19
[후방/은꼴] 심심해서 후방
20
[일상/생활] K-빙수, 실리콘밸리까지 정복하다
1
[컴퓨터] 마이크로소프트, 차세대 AMD 인스팅트 및 AMD 에픽 프로세서 도입
2
[메모리/스토리지] ADATA DDR5-6000 CL30 ARMAX RGB 패키지 파인인포 32GB [써보니]
3
[축구] 드디어 성사된 역대 최고의 라이벌전 '잉글랜드-아르헨티나' 4강 격돌
4
[일상/생활] 코스피 바닥 신호들이 슬슬 보이는 중
5
[일상/생활] 다나와 히트브랜드 오프라인 팝업 행사
6
[개발뉴스] Cloudera·VAST Data, 어디서나 구축 가능한 AI 데이터 플랫폼 위해 전략적 제휴
7
[사건/사고] MSI 유상 수리 논란… CPU 소켓 수리 된 메인보드도 재차 고장
8
[모바일] 삼성전자, 갤럭시 Z 폴드8 울트라·폴드8·플립8 등 폴더블 3종 라인업으로 확대
9
[일상/생활] 고양이 품종별 지능 순위
10
[공연 예술] ‘2026 국립극장 시네마 투어’ 개최
11
[컴퓨터] 코잇, ASUS GeForce RTX 그래픽카드 국내 공식 유통 확대
12
[카메라] 니콘이미징코리아, 전시회 기획부터 포트폴리오 제작까지… 8월 니콘스쿨 커리큘럼 공개
13
[컴퓨터] 서린씨앤아이, 리안리 커브드 OLED 디스플레이 적용 수랭 쿨러 하이드로시프트 II 시리즈 출시
14
[일상/생활] 딸이 사온 고기, 엄마는 다이어트라 거절
15
[연예인] 모델 심유이 시원한 비키니 공개
16
[공연 예술] 희망제작소·카카오, ‘대한민국 사회혁신 컨퍼런스 2026’ 개최
17
[일상/생활] 온라인 전용 여포 과자 등장
18
[일상/생활] 특수부대 17년 베테랑 몸상태
19
[일상/생활] 서울 하천, 변신과 회복의 두 얼굴
20
[일상/생활] LH 청년임대 퀄리티, 급이 나뉘는 수준
조텍 프래그마타 게임 번들
삼성이 현실 업무 생산성에 초점을 맞춘 AI 벤치마크 ‘TRUEBench(Trustworthy Real-world Usage Evaluation Benchmark)’를 공식 발표했다. 삼성리서치가 개발한 TRUEBench는 대규모 언어 모델(LLM)이 실제 직장 환경에서 얼마나 생산적으로 작동하는지를 평가하기 위해 설계됐으며, GPT-5가 첫 리더보드에서 선두를 기록했다. TRUEBench는 기존 벤치마크가 가진 한계를 정면으로 겨냥했다. 기존 평가 방식은 단순한 질의응답 구조와 영어 중심의 테스트에 치우쳐 실제 업무 환경을 충분히 반영하지 못한다는 지적이 있었다. 삼성은 이를 개선하기 위해 10개 평가 카테고리와 46개 세부 항목, 12개 언어(한국어 포함), 그리고 2,485개 테스트 세트를 마련했다. 이 테스트는 짧게는 8자에서 길게는 2만 자 이상에 이르는 요청을 포함해, 단순 질의부터 대규모 문서 요약에 이르는 다양한 난이도를 아우른다. 평가 과정도 차별화됐다. TRUEBench는 단순히 정답 여부를 따지지 않고, 사용자가 명시하지 않은 암묵적 요구 조건까지 충족하는지를 고려한다. 평가 기준은 사람과 AI의 협업으로 다듬어진다. 먼저 사람이 기준을 세우고, AI가 이를 검토해 오류와 모순을 찾아내면 다시 사람이 보완하는 과정을 반복한다. 이렇게 교차 검증된 기준을 토대로 AI 자동 평가가 이루어지며, 모든 조건을 충족해야 통과할 수 있어 세밀하고 일관된 점수가 산출된다. 삼성리서치는 이번 발표에서 “실제 업무 환경에서의 AI 활용 경험을 바탕으로 한 TRUEBench가 생산성 평가의 표준을 제시하고, 삼성의 기술적 리더십을 강화할 것”이라고 강조했다. 특히 GPT-5가 초기 리더보드에서 가장 높은 점수를 기록해, 향후 경쟁 모델과의 비교에서도 중요한 기준점이 될 것으로 전망된다. TRUEBench의 데이터 샘플과 리더보드, 평균 응답 길이 정보는 오픈소스 플랫폼 허깅페이스(Hugging Face)에서 공개되며, 최대 5개의 모델을 동시에 비교할 수 있다. 이로써 기업과 개발자는 성능과 효율성을 한눈에 파악하며 모델 선택에 참고할 수 있을 것으로 보인다. 삼성은 TRUEBench가 단순한 성능 수치 이상의 현실적 지표를 제공해, 업무 환경에 최적화된 AI 모델을 선별하고 발전시키는 데 중요한 역할을 할 것으로 기대하고 있다. 구경하러가기. https://huggingface.co/spaces/SamsungResearch/TRUEBench
2025.09.25
0
0
인사이
  • 종합
  • 뉴스/정보
  • 커뮤니티
  • 질문/토론