The Millennium Problems for Biology
생물학의 밀레니엄 문제
생명의 기원부터 네 염기 코돈, 인공 효소, 생체 보존까지 생물학에서 풀어야 할 12가지 과제를 제시합니다. 각 과제는 실험 대상과 정량적인 성공 기준을 함께 규정합니다.
- 주제
AI 요약
이 목록은 생물학의 큰 질문을 추상적으로 나열하지 않고, 실험으로 판정할 수 있는 문제와 성공 조건을 함께 제시합니다. 생명의 기원, 포유류 장기 보존, 유전정보의 변환, 단백질 설계, 유전자 치료 생산, 조직 재생, 질소 고정처럼 서로 다른 분야를 다루며, 일부 과제는 사전 등록된 표본 수와 정확도, 생존율, 반응 속도, 오프타깃 비율까지 요구합니다.
■ 생명의 기원과 새로운 유전 체계
첫 번째 과제는 화학적 전구체에서 생명이 실험실 안에서 자발적으로 출현하는 과정을 보이는 일입니다. 그럴듯한 원시 수프와 에너지원을 사용하고, 외부의 도움 없이 자기 복제하는 RNA 및 단백질 기반 세포가 생겨나야 합니다. 여기서 세포는 경계가 분명한 어떤 구획이어도 되지만, 충분한 원시 수프와 에너지를 공급했을 때 개체 수가 약 20세대에 해당하는 10⁶배 이상 증가해야 합니다. 분열을 반복할수록 세포 크기가 계속 작아지는 방식은 인정하지 않습니다. 충분한 에너지와 원시 수프가 주어지면 분열을 무한히 이어갈 가능성도 있어야 합니다. 세포 안에 저장된 정보가 분자 조성을 인과적으로 결정해야 하며, 핵산이나 폴리펩타이드 같은 고분자에 유전정보를 저장하는 방식을 선호합니다.
다섯 번째 과제는 네 염기 코돈을 사용하는 살아 있는 세포를 만드는 일입니다. 모든 단백질 코딩 서열과 번역 장치까지 겹치지 않는 네 염기 코돈으로 인코딩해야 하며, 관찰 가능한 세 염기 해독이 없어야 합니다. 단순히 네 번째 염기를 덧붙였지만 앞의 세 위치만으로 아미노산이 결정되는 방식은 배제합니다. 코돈 안에서 돌연변이가 발생한 위치와 상관없이 비동의 치환이 일어날 확률이 비슷해야 진정한 네 염기 코딩으로 인정합니다. 이 문제는 Erika Alden DeBenedictis가 제안했습니다.
열한 번째 과제는 3′→5′ 방향으로 작동하는 중합효소 세트를 만드는 일입니다. 3′→5′ DNA polymerase, RNA polymerase, reverse transcriptase, RDRP를 모두 만들어야 합니다. 각 효소는 각각 Taq, T7 RNA polymerase, M-MLV reverse transcriptase, Phi 6 RDRP와 비슷하거나 더 나은 processivity와 오류 특성을 보여야 합니다. 효소는 새로 설계하거나 자연계에서 찾거나 기존 효소를 개량하고 진화시켜 만들 수 있습니다.
■ 생체 보존과 조직 재생
두 번째 과제는 살아 있는 야생형 성체 생쥐를 얼리거나 vitrification 상태로 보존했다가 높은 생존율로 되살리는 일입니다. 온전한 생쥐를 최소 24시간 frozen 또는 vitrified 상태로 유지하고, 회복 뒤 생존율이 99%를 넘어야 합니다. 영구적인 장기 손상이나 신체 손상도 없어야 합니다. 체세포 유전공학은 권장하지 않지만 허용하며, 모든 실험에는 윤리 승인이 필요합니다.
여섯 번째 과제는 성체 야생형 생쥐에서 절단한 팔다리를 재생하는 일입니다. 재생 뒤 운동 기능 검사에서 대조군과 구별되지 않아야 하고, 새로 자란 팔다리의 감각 인지도 차이가 없어야 합니다. 비침습 관찰 자료만 본 맹검 평가자가 재생된 팔다리인지 구분하지 못해야 합니다. 이 과제 역시 윤리 승인을 요구합니다.
■ 단백질과 핵산 사이의 정보 변환
세 번째 과제는 임의의 펩타이드 서열을 RNA 또는 DNA로 역번역하는 효소를 만드는 일입니다. 정제한 단백질 촉매나 고정형 단백질 복합체가 표지가 없는 폴리펩타이드를 순차적으로 읽고, 별도의 핵산 주형 없이 잔기 서열을 나타내는 핵산 가닥을 합성해야 합니다. 사전에 정한 코돈 규칙을 사용해야 하며, 미리 붙인 서열 바코드, 잔기별 작업 순서, 데이터베이스 조회에 의존하면 안 됩니다. 결과물은 일반적인 polymerase와 ligase, 유사 효소로 증폭하거나 분석할 수 있어야 합니다.
검증에는 길이 50개 이상의 무작위 펩타이드 100개를 사전 등록하고 합성해 섞어야 합니다. 역번역과 sequencing만으로 사전이나 서열 사전 없이 원래 서열을 추론해야 하며, 잔기 기준 정확도는 최소 90%여야 합니다. 평균 판독 길이는 25잔기 이상, 평균 read quality score는 Q10 이상이어야 합니다.
열 번째 과제는 임의의 펩타이드를 지수적으로 증폭하는 반응을 만드는 일입니다. 입력 단백질에 의존해 아미노산 단량체에서 새로운 전장 폴리펩타이드 사본을 합성해야 하며, 서열을 정확히 보존해야 합니다. 핵산 주형이나 미리 만들어 둔 대응 scaffold 없이 한 반응 용기에서 진행해야 합니다. 길이 50개 이상의 무작위 펩타이드 100개를 사전 등록한 뒤, 용액 속 양을 1000배 이상 늘리고 잔기별 서열 정확도 90% 이상을 보여야 합니다. 펩타이드 sequencing을 명시적으로 사용하는 방법과 reverse translation으로 핵산 중간체를 만드는 방법은 허용하지 않습니다.
■ 효소 설계와 대사 반응
네 번째 과제는 자연계의 성능 경계를 넘어서는 Rubisco를 만드는 일입니다. 후보 효소는 ribulose-1,5-bisphosphate를 carboxylation하면서 산소보다 이산화탄소를 선호하는 정도인 Sc/o가 Galdieria Partita Rubisco 이상이어야 합니다. 동시에 turnover 수치인 kcat은 maize Rubisco 이상이어야 합니다. 후보 효소와 G. Partita Rubisco, maize Rubisco를 각각 대조군으로 포함한 짝지은 효소 분석으로 두 수치를 측정해야 합니다.
열두 번째 과제는 자연계 질소고정효소 계열과 서열 또는 구조적 상동성이 없는 새로운 nitrogenase를 만드는 일입니다. 새 단백질은 N₂를 암모니아로 바꿔야 하며, 반응 속도는 자연계 단백질과 비슷한 규모 이상이어야 합니다. 동시에 알려진 모든 nitrogenase와 nitrogenase 유사 단백질을 기준으로 서열 및 구조 유사성 임계값보다 충분히 낮아야 합니다.
여덟 번째 과제는 특정 단백질 서열을 정확하고 효율적으로 자르는 효소를 주문형으로 설계하는 일입니다. 접힌 내인성 단백질 안에서 접근 가능한 위치를 하나 제시하면, 살아 있는 세포에서 해당 위치를 자르는 protease를 사전에 설계해야 합니다. 촉매 효율과 전체 proteome에서의 오프타깃 절단 수준은 널리 쓰이는 site-specific protease와 비슷하거나 더 좋아야 합니다. 사전 등록한 표적 20개 가운데 80%를 넘는 성공률이 필요하며, 표적을 공개한 뒤 단백질 설계와 생산을 24시간 안에 끝내야 합니다. 단백질 생산을 제외한 사전 wet-lab screening이나 표적별 진화는 허용하지 않습니다. 용액 속 사전 등록 펩타이드를 자르는 약한 형태의 과제는 부분 성공으로 취급합니다.
아홉 번째 과제는 세포 안쪽 표적에 결합하는 단백질 binder를 만드는 일입니다. 추가 진화나 최적화 없이 zero-shot으로 설계한 단백질이 세포 밖에서 약리학적으로 가능한 농도로 투여됐을 때 살아 있는 세포 안의 사전 등록 표적과 안정적으로 결합해야 합니다. 세포 진입 방식도 치료에 적용할 수 있어야 하므로 transfection, intrabody 발현, electroporation, membrane disruption 같은 방법은 허용하지 않습니다. 사전 등록 표적 20개에서 성공률 80%를 넘어야 하고, 표적 공개 뒤 설계 단백질 생산을 24시간 안에 마쳐야 합니다. 인간화 monoclonal antibody와 비슷한 해법을 선호하지만, 과제의 범위는 모든 단백질 binder로 넓혀 두었습니다.
■ 생명공학 생산 플랫폼
일곱 번째 과제는 세균을 이용해 유전자 치료용 바이러스를 만드는 일입니다. 세균 안에서 감염 가능하지만 복제는 불가능한 AAV와 lentivirus를 생산해야 하며, 입자에는 사전에 정한 바이러스 genome이 들어 있어야 합니다. 물리적 capsid와 viral genome의 비율, infectious unit와 viral genome의 비율이 포유류 세포 배양에서 정제한 바이러스의 비율과 비슷해야 합니다. 바이러스 genome은 nuclease에도 견뎌야 합니다. lentivirus 생산이 AAV보다 훨씬 어려울 것으로 예상되므로, AAV만 생산해도 부분 성공으로 인정합니다.
■ Hacker News 반응
커뮤니티에서는 목록에 포함할 문제의 기준과 AI 기업의 과학 연구 역할을 두고 의견이 갈렸습니다.
- @freebsd_lovefes — 중요한 항목이 빠진 것 같습니다. 연료를 생산하거나 플라스틱을 분해하는 박테리아 같은 것 말입니다.
- @flexagoon — 플라스틱을 분해하는 박테리아는 자연적으로도, 합성으로도 이미 존재합니다. 제가 다니는 대학에서는 그것을 최적화하는 일이 가장 인기 있는 학생 프로젝트 중 하나입니다. 밀레니엄 문제라고 하기는 어렵습니다.
- @bonsai_spool — 사실 터무니없습니다. Allen Institute나 실제로 평판 있는 기관이 만든 목록인 줄 알았습니다.
- @HarHarVeryFunny — 제가 보기에 우스운 점은 수학에서조차 이런 목록을 만들고 AI 회사들이 해결하길 기대하거나 바라는 일입니다. AI 회사에서 일하는 사람들은 LLM 구축 외 분야의 과학자나 전문가가 아닙니다. 정말 어려운 문제, 단순히 계산이 어려운 문제가 아니라면, 진전을 이룰 가장 좋은 방법은 고급 도구를 실제 과학자 손에 쥐여주는 일입니다.
- @zhaoziyuan2000 — LLM의 범용성을 증명하려는 조급한 속도 속에서 AI 회사들이 과학계 전반과 충분한 소통 없이 전통적인 과학 연구자의 역할까지 맡으려는 것 같습니다. 실제 과학자에게 도구를 주는 일이 큰 도움이 된다는 점에는 동의합니다. 하지만 그들의 피드백을 기다리거나 읽어낼 인내가 있는지는 의문입니다.
원문: Millennium Problems for Biology / 번역·요약: Trawling