← Alle Experimente
exp_17

Sequenz-Alignment

Wie ähnlich sind sich zwei Sequenzen, und welcher Buchstabe gehört zu welchem? In der Bioinformatik wird das mit einer Tabelle berechnet, die Zelle für Zelle ausgefüllt wird. In diesem Experiment füllt sie sich von selbst, für einfache Wörter genauso wie für das Hämoglobin von Mensch und Maus.

Laborbuch · S. 17 ·

Tipp auf eine Zelle oder fahr mit der Maus drüber, dann siehst du, wie ihre Zahl zustande kommt. Der gelbe Textmarker ist der Rückweg: An ihm liest man ab, welche Buchstaben zusammengehören.

Was steckt dahinter?

Wenn Biolog:innen ein neues Gen oder Protein finden, ist die erste Frage meistens, welchem bekannten Gen oder Protein es ähnlich sieht. Dafür legt man die beiden Sequenzen Buchstabe für Buchstabe untereinander und lässt Lücken, wo die eine zusätzliche Buchstaben hat oder ihr welche fehlen. Das Problem ist, dass es astronomisch viele Möglichkeiten gibt, diese Lücken zu setzen. Schon bei kurzen Proteinen kann man unmöglich alle ausprobieren.

1970 haben Saul Needleman und Christian Wunsch dafür einen Trick benutzt, den man heute dynamische Programmierung nennt. Die Idee ist, dass sich das beste Alignment fürs Ganze aus den besten Alignments für die Anfänge zusammensetzt. Jede Zelle der Tabelle steht für den besten Score bis zu dieser Stelle und braucht dafür nur ihre drei Nachbarn. Kommt man von schräg oben links, werden die zwei Buchstaben ein Paar, und das gibt Plus- oder Minuspunkte, je nachdem wie gut sie zusammenpassen. Kommt man von oben oder von links, entsteht eine Lücke, und die kostet Punkte. Der beste der drei Werte kommt in die Zelle, und am Ende geht man den Pfeilen nach zurück. Das ist übrigens dieselbe Idee wie beim kürzesten Weg durch die Stadt in „Stadt, Bahn, Pilz“. 1981 haben Temple Smith und Michael Waterman noch eine Regel ergänzt: Keine Zelle darf unter null fallen. Dadurch vergisst die Tabelle schlechte Abschnitte und findet das beste gemeinsame Stück irgendwo mittendrin. Das nennt man lokales Alignment.

Für Proteine ist „gleicher Buchstabe oder nicht“ zu grob. Manche Aminosäuren tauschen in der Evolution ständig die Plätze, ohne dass es dem Protein schadet, andere fast nie. BLOSUM62 (Henikoff & Henikoff, 1992) zählt deshalb, wie oft jedes Paar in Blöcken verwandter Proteine vorkommt, und macht daraus Punkte. Tryptophan mit Tryptophan gibt zum Beispiel +11 Punkte, weil Tryptophan selten ist und kaum ersetzt wird. Ein Tausch von Isoleucin gegen Valin gibt immerhin noch +3.

Gut zu wissen

  • Vereinfacht ist, dass hier jeder Lückenbuchstabe gleich viel kostet. Echte Werkzeuge verlangen mehr fürs Öffnen einer Lücke als fürs Verlängern (affine Lückenkosten, dafür braucht man drei Tabellen statt einer), weil eine lange Einfügung wahrscheinlicher ist als viele kurze.
  • Oft gibt es mehrere gleich gute Wege durch die Tabelle. Die Pfeile zeigen alle, der Textmarker nimmt einen davon (erst diagonal, dann oben, dann links). Andere Programme nehmen vielleicht einen anderen mit demselben Score.
  • Die Tabelle wächst mit dem Produkt der beiden Längen. Zwei Proteine gehen gut, ein ganzes Genom gegen eine Datenbank aber nicht. Deshalb suchen BLAST und ähnliche Programme erst kurze exakte Treffer und alignen nur drumherum.
  • Die Prozentwerte hängen von der Bewertung ab. Mit anderen Lückenkosten kommt bei denselben zwei Proteinen etwas anderes raus, deshalb sollte man immer dazusagen, mit welchen Einstellungen man gerechnet hat.

Quellen

  • Needleman, S. B. & Wunsch, C. D. (1970). A general method applicable to the search for similarities in the amino acid sequence of two proteins. Journal of Molecular Biology, 48(3), 443–453. doi:10.1016/0022-2836(70)90057-4
  • Smith, T. F. & Waterman, M. S. (1981). Identification of common molecular subsequences. Journal of Molecular Biology, 147(1), 195–197. doi:10.1016/0022-2836(81)90087-5
  • Henikoff, S. & Henikoff, J. G. (1992). Amino acid substitution matrices from protein blocks. PNAS, 89(22), 10915–10919. doi:10.1073/pnas.89.22.10915 (die Matrixwerte wie von der NCBI veröffentlicht)
  • UniProt: P68871 (HBB_HUMAN), P02088 (HBB1_MOUSE), P02144 (MYG_HUMAN), CC BY 4.0. Dort steht auch die Sichelzell-Variante Hb S (Glutaminsäure → Valin).
  • NCBI RefSeq NM_000518.5 (kodierende Sequenz von HBB, die ersten 24 Basen)