논문 조사와 보고서 작성에 특화된 8B 오픈 웨이트 모델이 나왔습니다.
Ai2가 AstaBrief 8B를 공개했습니다. 연구 질문과 검색된 논문 내용을 입력하면 근거가 되는 인용을 붙여 보고서를 작성하며, 자체 하드웨어에서 실행할 수 있습니다. Qwen3-8B를 기반으로 실제 연구 질문과 인용 품질을 고려한 데이터로 학습했습니다.
Asta에서는 평균 보고서 생성 시간이 Claude 기반 Thinking 모드의 178.5초에서 51.1초로 약 3.5배 줄었습니다. 1/2
choi.openai님에게 답글 남기기...
블로그 : allenai.org/blog… 2/2

allenai.orgOpen-sourcing AstaBrief, the fast report-generation model in Asta | Ai2
[ 본문-영문을 한국어로 번역 ]
AstaBrief, Asta의 빠른 보고서 생성 모델 오픈소스 공개
2026년 10월 2일
아이2
언어 모델은 이미 연구자들이 문헌을 검색하고, 증거를 종합하고, 복잡한 질문을 해결하는 데 도움을 줄 수 있습니다. 그러나 과학 연구는 이러한 모델에 특별한 요구 사항을 제시합니다. 즉, 답변은 증거에 기반해야 하고, 모델은 연구 결론을 슬쩍 확장하는 것이 아니라 증거가 실제로 뒷받침하는 내용을 유지해야 하며, 연구자들은 최종 결과를 검증할 수 있어야 합니다.
과학자들이 당사의 과학 연구용 에이전트 플랫폼인 Asta를 사용하는 방식에서 이러한 점을 확인할 수 있습니다 . 사용자들은 단순한 키워드 검색 대신, 종종 풍부한 맥락과 다양한 제약 조건을 제시합니다. 예를 들어, 특정 방법, 대상 집단 또는 환경을 고려하면서 문헌 전반에 걸쳐 접근 방식을 비교하도록 Asta에 요청하는 식입니다. 또한 많은 사용자들이 생성된 보고서를 일회성 답변이 아닌 연구 결과물로 활용하여 나중에 다시 검토하기도 합니다.
저희는 과학자들이 더 빠르게 인용 논문을 생성할 수 있도록, 직접 다운로드하여 실행할 수 있는 모델을 제공하고자 했습니다. 이를 위해, 과학 논문 생성에 특화된 소규모 오픈 소스 모델이 기존에 사용하던 상용 모델과 동일한 수준의 논문 품질을 유지하면서 생성 시간과 서비스 비용을 절감할 수 있는지 테스트했습니다.
저희는 연구 질문과 검색된 문헌 발췌문을 인용 보고서로 변환하는 모델인 AstaBrief 8B를 개발했습니다. AstaBrief는 현재 Asta의 보고서 생성 기능에서 빠른 모드 와 Claude 기반의 사고 모드와 함께 사용할 수 있으며, 다른 연구자들이 저희의 접근 방식을 연구, 재현 및 발전시킬 수 있도록 모델과 학습 데이터를 오픈소스로 공개하고 있습니다.
AstaBrief 개발에는 수만 건의 실제 연구 질의, 인용 중심 필터링, 선호도 데이터, 그리고 기존의 섹션별 생성 방식이 아닌 전체 보고서를 한 번에 작성하는 재설계된 보고서 생성 파이프라인이 필요했습니다. 그 결과, 기존 모델과 비교했을 때 보고서 생성 시간이 거의 10분의 1 수준으로 단축되었습니다. 전체 Asta 파이프라인에서 Fast 모드는 보고서당 평균 51.1초가 소요되는 반면, Thinking 모드는 178.5초가 소요되어 약 3.5배 더 빠릅니다.
이러한 효율성 향상 덕분에 AstaBrief는 더 광범위한 목표, 즉 과학 연구의 특정 요구 사항에 맞게 조정할 수 있는 개방형 언어 모델을 구축하는 데 유용한 테스트 사례가 되었습니다.
개방형 가중치를 통해 연구 기관은 자체 인프라에서 AstaBrief를 실행할 수 있으며, 이는 연구 질문이 민감하거나 미발표된 연구 결과를 드러낼 때 필수적입니다. 모델 가중치와 함께 연구자들이 자신의 PDF 파일에서 보고서를 생성할 수 있도록 예시 워크플로를 공개하여 로컬 보고서 생성의 시작점을 제공합니다.
이 글에서는 AstaBrief를 어떻게 훈련시켰는지, 과학적 근거에 기반을 두는 과정에서 무엇을 배웠는지, 그리고 우리의 접근 방식 중 어떤 부분이 미래 과학 모델에 적용될 수 있을지에 대해 다룹니다. 설명된 훈련 및 평가의 대부분은 2025년에 완료되었으므로, 훈련 데이터 생성 및 비교 기준으로 사용된 자체 모델은 당시의 최첨단 기술을 반영합니다. 현재의 최첨단 모델을 대상으로 전체 평가를 다시 실행하지는 않았으며, 아래 결과는 우리가 테스트한 특정 훈련 및 시스템 설계 방식에 대한 근거로 이해하는 것이 가장 좋습니다.
모델 학습
AstaBrief 개발 목표는 장문의 과학적 종합 분석에 가장 중요한 요소인 답변의 질, 관련성, 구조, 그리고 인용 근거를 모두 갖춘 개방형 가중치 모델을 구축하는 것이었습니다. Qwen3-8B 데이터셋을 기반으로, 학습 후 데이터, 평가, 그리고 보고서 생성 관련 프레임워크 구축에 대부분의 노력을 집중했습니다.
범용 모델을 과학 연구에 맞게 조정하고, 새로운 과학 모델을 처음부터 학습시키는 것은 Ai2 전반에 걸쳐 폭넓게 연구되고 있는 분야입니다. Ai2가 주도하는 미국 국립과학재단 (NSF)의 OMAI (과학적 발견을 위한 완전 개방형 AI 인프라 및 모델 구축 국가 이니셔티브)를 통해, 저희 연구원들은 과학계와 직접 협력하여 미래의 개방형 모델에 필요한 것이 무엇인지, 그리고 현재의 범용 모델이 어떤 점에서 부족한지 파악하고 있습니다. 여기에는 과학 분야와 워크플로에 따라 요구 사항이 어떻게 다른지 연구하는 것도 포함되며, 향후 이 연구 결과를 더 자세히 공유할 예정입니다.
최근 연구(저희의 DR Tulu 포함 )는 강화 학습 기반(RL) 방법이 특히 평가자 모델이 학습 과정에 참여할 때 개방형 가중치 모델의 장문 보고서 생성 성능을 향상시킬 수 있음을 보여주었습니다. 저희는 AstaBrief에도 이러한 접근 방식을 고려했지만, 궁극적으로 지도 미세 조정(SFT)과 직접 선호도 최적화(DPO)를 중심으로 한 더 간단한 방법을 선택했습니다.
강화 학습 기반 훈련은 불안정하고 비용이 많이 들 수 있습니다. 우리는 더 저렴하고 운영 관리가 용이하며, 디버깅과 반복 작업이 더 쉬운 방식으로 보고서 생성 품질을 얼마나 향상시킬 수 있는지 확인하고 싶었습니다.
그렇기 때문에 훈련 데이터의 품질이 특히 중요했습니다. 잡음이 섞인 예제를 보완하기 위해 더 복잡한 최적화 방법을 사용하는 대신, 우리는 원하는 보고서 작성 동작을 실제로 보여주는 예제를 생성, 선택 및 필터링하는 방법을 찾는 데 프로젝트의 상당 부분을 할애했습니다.
또한, 사용자가 빠르게 예비 보고서를 얻고 후속 단계에서 이를 수정할 수 있도록 AstaBrief의 속도를 향상시키고자 했습니다. 속도 개선을 위해, 사용자의 질의와 관련 검색된 스니펫을 기반으로 최종 보고서를 한 번에 직접 생성하도록 AstaBrief를 학습시키기로 했습니다. 이는 기존의 클로드 기반 사고 모드에서 사용하는 비용이 많이 드는 스니펫 요약 및 클러스터링 단계를 생략하고, 답변을 섹션별로 출력하지 않는 방식입니다. 놀랍게도, 성능 저하 없이 이러한 방식을 구현할 수 있다는 것을 발견했습니다.
SFT 훈련 데이터 수집
학습 파이프라인은 저희 논문 " 검색 기능이 강화된 언어 모델로 과학 문헌 합성하기 "와 Asta의 보고서 생성 기능을 뒷받침하는 프레임워크인 ScholarQA를 통해 제출된 실제 사용자 질의로 시작되었습니다 . 저희는 단순히 합성된 프롬프트나 벤치마크 방식의 작업으로만 학습하는 대신, AstaBrief가 실제 과학자들의 실제 질의를 통해 학습하도록 하고 싶었습니다.
저희 연구 결과에 따르면 과학자들은 일반적인 챗봇이나 기존 검색 도구에 사용자들이 요구하는 것과는 다른 방식으로 언어 모델에 질문을 던지는 경우가 많습니다. 수십만 건의 Asta 쿼리를 분석한 결과 , 전문가 연구자들은 짧고 키워드 위주의 질문에 의존하기보다는 풍부한 맥락, 다양한 제약 조건, 그리고 개념 간의 관계를 제공하는 경우가 빈번했습니다.
최근 Asta 사용자 연구에서는 연구자들이 AI를 연구에 활용하는 방식에 대한 차이점도 드러났습니다. 어떤 연구자들은 아이디어 구상이나 실험에 모델을 사용하는 데 거리낌이 없는 반면, 다른 연구자들은 종합, 문헌 조사 또는 패턴 찾기와 같이 더 제한적인 역할을 선호합니다. 이러한 차이점에도 불구하고, 참여자들은 더 명확한 출처 추적성, 모델의 작동 방식에 대한 더 높은 가시성, 그리고 모델이 사용하는 맥락에 대한 더 큰 제어권을 원합니다.
수집한 사용자 로그를 품질, 관련성 및 개인정보 보호 기준에 따라 필터링했습니다. 베타 테스터 및 봇 트래픽을 제거하고, 의미가 없을 정도로 짧은 쿼리를 제외했으며, LLM 기반 필터링을 통해 영어 이외의 언어로 작성된 쿼리, 비과학적인 요청, 개인 정보가 포함된 프롬프트를 걸러냈습니다. 그 결과 9만 건의 연구 중심 쿼리가 남았습니다.
SFT의 경우, Asta의 보고서 생성에 사용되는 다단계 ScholarQA 파이프라인을 활용하여 필터링된 쿼리로부터 전체 보고서 형태의 목표 출력을 생성했습니다. 이 파이프라인은 관련 문헌을 검색하고, 자료를 섹션별로 정리한 후, 보고서 생성 모델을 사용하여 증거를 종합하여 인용 보고서를 생성했습니다. 이를 위해 Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1 등 다양한 자체 개발 시스템을 활용했습니다. 품질 필터링을 거친 후, 47,000개의 유효한 학습 예제를 얻었습니다.
DPO 쌍 생성
DPO는 기존과는 다른 유형의 학습 데이터를 요구했습니다. 쿼리당 하나의 대상 보고서가 아니라, 둘 중 하나가 선호되는 보고서 쌍이 필요했습니다.
우리는 SFT 데이터 생성 과정에서 사용되지 않은 별도의 쿼리 하위 집합을 사용하여 이러한 쌍을 구축했습니다. 각 쿼리당 하나의 보고서는 기존 ScholarQA 파이프라인에서 가져왔으며, 일반적으로 Claude 3.5 Sonnet 또는 3.7 Sonnet을 사용했습니다. 경쟁 보고서는 ScholarQA에서 검색된 문헌 발췌문을 다른 모델(예시에 따라 o3, o4-mini, DeepSeek-V3 또는 DeepSeek-R1)에 입력하여 생성했습니다.
두 개의 평가 모델(GPT-4.1과 DeepSeek-R1)이 각 쌍을 비교하여 승자를 선정했습니다. LLM 평가 모델이 인간의 선호도와 일치하도록(95% 일치) 했으며, 두 평가 모델 모두 동의한 쌍만 유지했습니다. 이를 통해 더욱 깔끔한 선호도 데이터 세트를 얻고 대규모로 생성된 선호도 데이터에서 흔히 나타나는 노이즈를 상당 부분 제거했습니다.
품질 필터링을 거친 후, 최종 DPO 데이터 세트는 약 6,000개의 예제로 구성되었습니다.
여러 생성기를 사용하고 두 심사위원 간의 합의를 요구함으로써, 우리는 어떤 단일 모델의 출력이나 판단도 정답으로 간주하지 않고 선호도 데이터를 구성하는 비교적 간단한 방법을 얻었습니다.
더 나은 원인 분석을 위한 데이터 필터링
우리의 주요 평가 대상은 사용자가 작성한 200개의 컴퓨터 과학 연구 질문으로 구성된 SQABench-CS2 였습니다 . AstaBrief 개발 과정 전반에 걸쳐 네 가지 지표를 추적했습니다.
평가 기준표 점수는 보고서에 필요한 내용이 얼마나 포함되어 있는지를 측정하는 지표입니다.
답변 정확도는 각 단락이 질문과 관련성이 있는지 여부를 측정합니다.
인용 정확도는 각 인용이 해당 인용이 뒷받침하는 주장을 얼마나 잘 뒷받침하는지를 측정하는 지표입니다.
인용 재현율은 보고서의 주장이 제공된 인용문에 의해 충분히 뒷받침되는지 여부를 측정하는 지표입니다.
최종 모델의 경우, 다음과 같은 2차 평가도 수행했습니다. 최근 ArXiv 논문을 기반으로 구축된 장문 연구 종합을 위한 63개 쿼리 벤치마크인 DeepScholarBench 와 Claude 기반 파이프라인에서 생성된 보고서에 대한 두 가지 별도의 쌍별 평가(SQABench-CS2에 대한 LLM 기반 비교 및 소규모 인체 연구)입니다.
보고서는 질문에서 벗어나거나 근거가 뒷받침되지 않는 주장에 인용문을 덧붙이는 등, 세련되고 완벽한 것처럼 보일 수 있습니다. 과학적 종합을 위해서는 이러한 행태들을 개별적으로 측정해야 했습니다. 하지만 인용문으로 뒷받침되는 것만으로는 과학적 타당성을 판단할 수 없습니다. 모델은 적절한 연구를 인용했더라도 해당 연구 자체의 근거보다 더 강력한 주장을 펼칠 수 있습니다. 이는 미묘한 방식으로 나타날 수 있는데 , 예를 들어 특정 표본에 대한 연구 결과를 전체 모집단에 대한 일반적인 주장으로 바꾸거나, 과거 시제로 보고된 결과를 보다 보편적으로 사실처럼 들리는 현재 시제 진술로 바꾸거나, 서술적인 연구 결과를 임상의, 정책 입안자 또는 연구자가 해야 할 일에 대한 권고로 바꾸는 경우입니다.
그러한 일반화는 과학 보고서 작성에 특히 중요한데, 각 단계마다 명백히 잘못된 진술을 도입하지 않고도 증거의 범위를 넓힐 수 있기 때문입니다. 따라서 인용된 문장은 출처와 기술적으로 관련이 있을 수 있지만, 연구자들이 실제로 밝혀낸 내용을 과장할 수도 있습니다. 저희 개발 평가 기준은 주로 관련성, 범위, 인용 근거에 중점을 두었지만, 과학 보고서 작성자에 대한 보다 심층적인 평가는 출처의 주장의 범위와 타당성을 유지하는지 여부도 검증해야 합니다.
초기 SFT 실행 결과는 전반적인 콘텐츠 품질을 향상시켰지만, 답변 정확도와 인용 품질 면에서는 여전히 Claude 기반 보고서 생성 파이프라인에 비해 뒤처졌습니다. 다시 말해, 모델은 보고서 작성 능력은 향상되었지만, 과학적 종합에 필요한 만큼 일관되게 근거에 기반한 보고서를 생성하지는 못했습니다.
그 덕분에 데이터 품질에 더 많은 시간을 투자하게 되었습니다. 우리는 통계 기반 필터 네 가지를 테스트하여 품질이 떨어지는 합성 학습 예제를 식별했습니다.
출력 대 입력 토큰 비율 . 비율이 매우 높은 답변은 증거가 부족한 상태에서 많은 양의 텍스트를 생성하기 때문에 종종 노이즈가 많았습니다.
인용 관련성 . 학습 데이터 세트에 있는 각 가상 보고서에 대해, 해당 보고서가 인용한 논문들의 검색 관련성 점수를 평균냈습니다. 평균값이 낮을수록 해당 보고서가 순위가 낮은 증거에 지나치게 의존하고 있음을 시사합니다.
인용 밀도 . 우리는 최소 하나 이상의 인용을 받은 진술의 비율을 측정했습니다. 인용 밀도가 낮은 보고서는 종종 근거가 없는 텍스트가 상당 부분 포함되어 있었습니다.
인용 다양성: Claude 기반 보고서 검색 파이프라인에서 반환된 논문 세트를 기준으로, 답변에 인용된 논문의 비율을 측정했습니다. 점수가 낮을수록 보고서가 몇몇 논문에 지나치게 의존하고 있음을 나타냅니다.
가장 큰 성능 향상은 인용 밀도가 낮은 합성 보고서를 필터링했을 때 나타났으며, 더 적극적인 필터링, 필터 조합 및 학습률 스윕은 의미 있는 성능 향상을 가져오지 못했습니다.
이 프로젝트에서 얻은 가장 분명한 교훈 중 하나는 더욱 정교한 필터링이 반드시 더 나은 결과를 가져오는 것은 아니라는 점이었습니다. 합성 보고서들이 주장을 일관되게 인용하는지 여부와 같은 비교적 단순한 신호가 우리가 시도했던 여러 복잡한 조합보다 훨씬 더 유용했습니다. 다시 말해, 과학적 전문성은 단순히 사전 학습에 더 많은 과학 텍스트를 추가하는 것만으로는 얻을 수 없습니다. 사후 학습 데이터의 구성과 품질, 그리고 데이터가 근거 제시 및 귀인과 같은 행동을 보이는지 여부가 결과 모델의 성능에 상당한 영향을 미칠 수 있습니다.
실용적이고 유용한 결과물에 중점을 두는 이러한 접근 방식은 Asta 사용자 조사에서 얻은 의견과도 일치합니다. 참여자들은 더 많은 텍스트를 생성하는 것이 반드시 더 유용한 것은 아니라고 지적했습니다. 그들은 불필요한 결과물을 일일이 살펴보지 않고도 결과를 검토하고 검증할 수 있도록 간결한 요약과 충분한 출처 추적성을 원합니다.
SFT 체크포인트를 강화한 후, 그 위에 DPO 교육을 진행했습니다. 이 단계를 통해 성능이 더욱 향상되어 AstaBrief가 보고서 생성 측면에서 Asta 및 DR Tulu의 Claude 기반 보고서 파이프라인과 거의 비슷한 수준에 도달했습니다.
접근 방식의 유효성 검증
이 모델은 독립적인 모델이 아닌, 저희의 에이전트 기반 Asta 보고서 생성 프레임워크의 일부로 작동하도록 설계되었기 때문에, 저희의 주요 질문은 AstaBrief가 훨씬 빠르고 저렴한 보고서 생성 파이프라인을 구현하면서도 저희가 중요하게 생각하는 보고서 품질을 유지할 수 있는지 여부였습니다. 다시 말해, 단순히 개별 벤치마크에서 더 강력한 자체 개발 모델과 동등한 성능을 보이는지 여부만이 아니라, 훨씬 간소화된 시스템으로 얼마나 많은 품질을 유지할 수 있는지 알고 싶었습니다.


개발 과정에서 사용한 평가에서 AstaBrief는 여러 답변 및 인용 품질 지표에서 Claude 기반 파이프라인 및 DR Tulu와 경쟁력 있는 성능을 보였습니다. 아래 차트는 LLM으로 평가한 비교 결과를 보여줍니다. 별도의 14개 문항으로 구성된 인체 대상 연구에서 세 명의 과학 연구원이 각각 4~5개의 문항에 응답하여 세 시스템의 보고서를 전반적인 선호도, 완성도, 관련성, 구성, 인용 정확도(동점 허용)를 기준으로 순위를 매겼습니다. 전반적인 선호도에서는 DR-Tulu가 우위를 차지했지만, 세 명의 연구원 중 두 명은 인용 정확도 측면에서 AstaBrief를 다른 시스템보다 선호하여 SFT 데이터 품질 필터의 유용성을 입증했습니다.

이 수치들은 당시 우리가 이 엔지니어링 접근 방식을 개발했을 때의 타당성을 입증하는 것으로 해석하는 것이 가장 적절하며, 현재의 최첨단 기술과 비교했을 때 이 특정 기본 모델이 어느 위치에 있는지를 나타내는 주장으로 보기는 어렵습니다. 모델 생태계는 빠르게 변화하고 있으며, 데이터 구성, 속성 필터링 및 서비스 제공에 대한 교훈들이 일반화될 수 있는 부분이라고 생각합니다.
AstaBrief의 유용성을 검증하기 위해 Asta의 빠른 모드(Fast mode)를 사용해 본 결과, 초기 사용률이 고무적인 것으로 나타났습니다. 빠른 모드를 사용해 본 374명의 Asta 사용자 중 29.1%가 이틀 이상 사용했으며, 사용자들은 평균적으로 빠른 모드를 사용하여 3.67개의 보고서 스레드를 생성했습니다. 빠른 모드를 사용해 본 사용자 중 23%는 이후에도 계속 빠른 모드를 사용했으며, 생각 모드(Thinking mode)로 전환하지 않았습니다. 추가로 18%는 목표에 따라 빠른 모드와 생각 모드를 번갈아 사용했으며, 전체 스레드의 약 40%에 빠른 모드를 사용했습니다.
피드백이 전반적으로 부족하여 확실한 결론을 내리기는 어렵지만, 빠른 모드가 사고 모드와 비슷한 비율(84.2% 대 85.2%)로 긍정적인 피드백을 받는 것을 확인할 수 있습니다.
앞으로 어떻게 될까요?
Asta의 보고서 생성 기능은 AstaBrief를 활용한 최초의 상용 사례로, 연구원들에게 기존의 사고 모드와 더불어 개방형 가중치를 사용하는 빠른 모드를 제공합니다. 이 모델은 개방형 가중치를 사용하기 때문에 기관들은 보고서 생성을 위해 독점적인 모델 API에 의존하지 않고 자체 하드웨어, 심지어 방화벽 내부에도 모델을 배포할 수 있습니다.
Asta에서는 이를 통해 연산 집약적인 작업을 위한 옵션으로 사고 모드를 유지하면서 보고서 생성 파이프라인의 해당 부분을 직접 연구하고 개선할 수 있습니다.
아직 할 일이 많습니다. 더욱 세밀한 선호도 학습, 더욱 강력한 RAG-plus-RL 접근 방식, 다중 턴 및 다중 도구 기능, 추가적인 과학 데이터 소스, 그리고 질의 분해 등을 연구하고 있습니다. 또한, 주장에 대한 근거 인용 여부를 넘어 모델이 증거를 얼마나 잘 보존하는지 평가하는 데에도 관심을 두고 있습니다. 이는 연구 결과물로서 보고서의 질을 더 잘 파악하고, 모델이 출처의 증거 범위를 얼마나 잘 유지하는지를 평가하기 위함입니다. 여기에는 간결성과 구성, 그리고 모델이 표본별 결과를 광범위한 일반화로 전환하거나 서술적 결과를 권장 사항으로 변환하는지 여부 등이 포함됩니다.
AstaBrief는 ScholarQA와 DR Tulu부터 현재 개발 중인 Olmo의 차기 버전까지, 과학 분야 언어 모델에 대한 오랜 연구 과정의 일환입니다. 특히 학습 데이터, 필터링, 평가 측면에서 얻은 교훈은 향후 개발에 큰 도움이 될 것입니다.
Hugging Face에서 AstaBrief를 다운로드하세요 .
💬 댓글 (0)