https://www.science.org/content/blog-post/evaluation-deep-research-performance

Just a moment...Just a moment...www.science.org


24b0d121e09c28a8699fe8b115ef046c65f3




5줄 요약:


데릭 로는 OpenAI의 "Deep Research" 소프트웨어를 탈리도마이드 독성 연구를 통해 평가하며, 과학적 연구 능력에 대한 의문을 제기합니다.


Deep Research는 문헌을 인용하고 요약하는 능력은 뛰어나지만, 최신 연구를 우선시하지 않고 다양한 설명을 나열하는 '완전성 편향'을 보이며, 용어 혼동의 문제도 드러냅니다.


특히 세레블론 메커니즘과 표적 단백질 분해의 연관성처럼 중요한 맥락을 놓치는 점은 심각한 결함으로 지적됩니다.


출력물은 유창하고 자신감 있게 제시되지만, 오류와 약점을 감추는 경향이 있어 사용자가 주제 전문가가 아니라면 오해를 불러일으킬 수 있습니다.


결론적으로 Deep Research는 인상적인 부분도 있지만, 심층적인 연구에는 한계가 있으며, 사용자가 내용을 제대로 이해하고 비판적으로 검토해야 함을 강조합니다.






댓글 반응)

Ben:

이것이 모든 LLM의 큰 문제입니다. 출력의 일부는 훌륭하고, 일부는 완전 헛소리이며, 구별할 방법이 없습니다. 과거에 그런 상사를 둔 적이 있지만, 그들 역시 오래가지 못했습니다.

Brähman Masshollari:

제 생각에 AI가 인기 있는 이유는 AlphaFold와 같은 것들이 끔찍한 과학(삼량체, 노나데카머, 5개의 마그네슘 또는 20개의 ATP가 결합된 것들)을 포장하는 데 사용할 수 있는 반짝이는 새 포장지와 같기 때문입니다. 그런 다음 패키지를 저널에 보낼 수 있습니다. 어떤 동료 심사위원이 AI의 우월한 지능에 의문을 제기하겠습니까?

이제, 새로운 Deep Chinese 기즈모에 물어봐야지:
인터넷 검색 엔진, 검색 엔진,
누구나 쓰다듬고 싶어하는 가장 잘생긴 덩치는 누구입니까?
(95% 신뢰 수준에서)

Tom Dougherty:

AI와 그 주변의 과대 광고에 대해 Ed Zitron의 블로그를 추천합니다. 특히 Deep Impact. 매우 길지만 읽을 가치가 있습니다. 다른 많은 요점들 중에서, 그는 (여기 독자들에게는 놀라운 일이 아니지만) "AI 맥락에서 추론은 프롬프트를 다른 접근 방식의 "고려 사항"과 함께 일련의 다른 단계로 나누는 방식으로 작동합니다. 사실상 대규모 언어 모델이 작업을 진행하면서 작업을 확인하는 것이며, 생각은 포함되지 않습니다. 왜냐하면 이러한 모델은 "생각"하거나 "알지" 못하기 때문입니다."라고 말합니다.

또한 AI 과학자 Yann LeCun의 WSJ 기사에서 (그의 LinkedIn 게시물에서) 그는 다음과 같이 말합니다. "제가 LLM의 한계와 물리적 세계를 이해하고, 지속적인 기억을 가지며, 추론하고 계획할 수 있는 새로운 아키텍처의 잠재력에 대한 제 의견을 표현하는 월스트리트 저널의 기사: LLM은 할 수 없지만, 여러분의 고양이는 가지고 있는 지능적 행동의 네 가지 특징."

Ash Jogalekar:

저도 LLM에서 동일한 문제를 발견했습니다(이전보다 훨씬 적지만 여전히 환각을 일으킨다는 사실은 제외하고). 요약이나 글을 잘 못 쓴다기보다는 특히 중요하거나 놀라운 점을 강조해야 할 부분을 이해하지 못하는 것 같습니다. 여기서 뉘앙스와 전문성이 중요해지며, 여기서 당신이 설득력 있게 보여주었습니다.

LifeSciLife:

모든 인용이 실제로 진짜인지 확인할 수 있었습니까? 이전에 일부 AI 보고서에서 환각된 참조 문제가 있었습니다.

이것은 일반적으로 지식이 제한된 사람을 기본 수준으로 끌어올리는 것과 일치하는 것 같습니다. LLM 응용 프로그램에는 유용합니다. 하지만 이 앱의 틈새 시장이 정말 그것일까요? 전문가 수준의 정보를 제공하지 않는다면 이 앱의 대상 사용자는 누구입니까?

Dereklowe (LifeSciLife에게):

네, 그런 것 같아서 다행입니다.

KG:

Gemini의 "심층 연구" 옵션에서 제가 겪었던 것과 동일한 문제점을 지적하셨습니다. 특히 오래된 고전 연구를 인용(및 집중)할 가능성이 너무 높고, 최신 인용이 더 적절한 경우에도 최근 인용은 거의 없습니다. LLM과 "대화"하고 "2020년 이후의 인용에 초점을 맞춰 더 최근의 인용을 제공해 주시겠습니까?"라고 요청하는 것조차 일반적으로 성공하지 못했습니다.

결국, 상당히 오래된 작업을 조사한 부분의 논문을 만드는 데는 꽤 능숙했고, 최근 작업을 하는 데는 꽤 서툴렀습니다.

PhysicsIsFun:

일반인의 경우 이를 "결과를 의심하면서 받아들여야 함"으로 처리해야 합니까, 아니면 "최소한 두 개의 신뢰할 수 있는 출처에서 경험적으로 검증될 때까지 모든 말은 거짓으로 간주해야 함"으로 처리해야 합니까? 제가 새로운 것을 배우는 것을 좋아하지만 학생들에게 오해를 전달하지 않도록 주의해야 하기 때문에 묻습니다.

Glenn Friedman:

어떤 버전이 사용되었습니까, 4o, o1, o1 pro, o3? 1년, 2년 후에는 얼마나 더 좋아질까요?

MaryKaye (Glenn Friedman에게):

정말 알 수 없습니다. 개선 벡터가 훨씬 더 나은 솔루션을 가리키고 있습니까, 아니면 그렇지 않습니까? 우리는 이미 대규모 언어 모델 기반 접근 방식으로 수행할 수 있는 한계에 가까워졌을 수도 있고, 그렇지 않을 수도 있습니다.

정말 걱정되는 한 가지: 체스 오프닝을 연구할 때 플레이어는 마스터 게임 데이터베이스와 각 변형의 승/패/무 기록을 광범위하게 사용합니다. 그러나 이것 때문에 크게 당할 수 있습니다. 어떤 라인이 누군가 그것에 대한 매우 큰 문제를 발견할 때까지 인기가 있었고, 그 후에는 마스터 플레이에서 갑자기 사라졌다고 가정해 봅시다. 데이터베이스에는 그 라인이 좋아 보였던 수백 개의 게임이 있을 것입니다. 나빠 보였던 게임은 하나; 그리고 더 이상 게임이 없을 수도 있습니다. 이것은 좋은 승/패 비율을 제공하지만, 만약 당신이 그것을 플레이하고 상대방이 반박을 안다면, 당신은 끝장입니다.

예를 들어, 통계적 방법이 나쁜 것으로 판명되면, 그것을 사용하고 칭찬하는 논문이 그것을 비방하는 논문보다 훨씬 많을 수 있지만, 후자가 옳습니다. LLM이 이것을 어떻게 탐색할지 알기 어렵습니다.

buggyfunbunny (MaryKaye에게):

"LLM이 이것을 어떻게 탐색할지 알기 어렵습니다."

AI/LLM에 대한 저의 오랜 불만은 막 뒤에는 모두 거대한 상관 관계 행렬이라는 것입니다. 그리고 우리 모두 알다시피, 상관 관계는 인과 관계가 아닙니다.

오래된/나쁜 것 대 새로운/좋은 것: 웹의 측정 기준 중 하나는 링크이며, 많을수록, 더 좋을수록, 더 높은 점수입니다. 오래됨 = 높은 점수. 제 생각에는 이러한 모든 "모델"이 어떤 버전을 사용합니다. 이런.

OFL의 게시물에서 설명된 것처럼 영어를 사용하세요. 특히 미국식 버전은 완전히 불규칙한 언어입니다. 한 단어는 많고, 심지어 반대되는 의미를 가질 수 있습니다. 단어는 명사, 동사, 형용사 등 여러 클래스가 될 수 있습니다. AI/LLM이 문장/단락/등에서 단어의 "진실"을 정렬하려면 얼마나 많은 컨텍스트가 필요할까요?

AL/LLM은 Google 검색과 얼마나 다릅니까? 별로 다르지 않습니다. 완전히 바보 같은 짓입니다.

Dereklowe (MaryKaye에게):

과학 문헌에는 그런 것이 많습니다. 예를 들어 초기 키나제 억제제 선택성 논문은 현대적 기준으로는 쓰레기입니다. 하지만 그런 논문이 정말 많습니다.