2026年10月11日日曜日

『西宮記』電子テキスト構築プロジェクト(報告2 故実叢書本『西宮記』翻刻ルール)

巻7の入力にはもう一ヶ月くらいかかるので、9月10日からの進捗状況を。

増補故実叢書本『西宮記 第二』巻七の途中(一~一八頁)

まで入力し終えました。

Wordで入力した原稿をPDF化すると、A4用紙53枚分になりました。文字数を単純に数え上げると 18,783字となりました。9月10日から30日で上下2段組のテキスト18頁分を入力できました。

前回より多少ペースが落ちていますが、これは巻一が本文と割注だけの扱いやすいテキストだったのに対して、巻七には本文と割注に加えて、頭注と傍注がたくさん書き加えてあるからで、このうち頭注が、AIにとっては予想外に読みにくかったようで、正確に読んでもらえるまで試行錯誤をくり返しました。ある程度コツをつかんだので、次はもう少しペースアップしたいところです。

AIには、読みにくい箇所に出会うと、自分で読みやすいように字句を改変する特徴があり、それは本来、AIの長所というべきものなのですが、史料の翻刻に利用する場合は、一字一句ていねいにチェックする手間を、絶対に惜しまぬ必要があります。調子の良いときは、8、9割の正確さで、人間には不可能なスピードで一気に翻刻してくれるので、これを使わぬ手はないのですが、すべてAIに任せれば何とかなる、という話でないことは常に肝に銘じていきます。

さてAIは、作業の前に、これからする翻刻のルールをまとめて表示する必要があります。最初だけ自分で短いルールを作って、そのルールに従って作業を進めます。ひと仕事終わるたびに、次に向けて必要なルール変更をしてほしいと伝えると、新しいルールをAIのほうで勝手に更新してくれます。

ですので、これからもどんどん更新されるものですが、今使っている翻刻ルールの最終版を掲げておきます。現在ちょっと長めになっていますが、これをコピペしたあと、実際の作業が始まります。割と頻繁にバージョンアップしているので、よりシンプルなものが出来たらまた載せます。

  * * *

故実叢書本『西宮記』翻刻ルール

1 作業の目的

この作業は『西宮記』の文章を解釈・校訂する作業ではない。

故実叢書本の画像に見えている文字・記号・位置・順序・改行を、そのまま電子テキストへ転写する作業である。

したがって、

意味より字形、文章より位置、推測より画像を優先する。

文章として不自然でも、誤字・誤植と思われても、勝手に直さない。


2 最重要原則

文章を読もうとせず、画像上の文字列を座標順に転写する。

「この文脈ならこの字のはず」「この熟語になるはず」という推測をしてはならない。

特に、

  • 前後の意味が通るように字を変更する
  • 熟語として自然になるように補う
  • 行をまたいで文章を組み直す
  • 以前見た表現に似せて読む
  • 読めなかった字に、文脈からもっともらしい字を入れる

ことを禁止する。

読めない字を□にすることは許される。推測して誤字を入れることの方を重大な誤りとする。


3 読み順――縦一行を物理的な最下部まで読む

原則として、右上から左下へ読む。

縦一行について、

上端 → 物理的な最下部まで全部確認する → その左隣の行へ移る

という順序を厳守する。

一行の途中から隣の行へ移って文章をつなげてはならない。

特に重要なのは、丸数字や大きな空白があっても、その場所で一行が終わったと判断しないことである。

たとえば、

常、⑬         甚雨幷入夜之時、

のように、丸数字⑬のさらに下方に文字が続いている場合がある。

したがって、

丸数字がある → その下方を確認する → 文字がないことを確認してから左隣へ移る

という手順をとる。

文章として切れているように見えることを、一行終了の根拠にしてはならない。


4 本文

本文は、原画像の改行をそのまま残す。

丸数字①②③……は、画像上に存在する位置から絶対に移動しない。

たとえば、

諸卿着左衞門陣          ③大

とあれば、文章上③を別の場所に置いた方が自然に見えても、そのまま再現する。

空白にも位置上の意味があるため、明らかな空白は可能な限り保持する。

本文を読み終えたら、

  • 行頭
  • 行末
  • 丸数字の位置
  • 大きな空白の前後

を重点的に再確認する。


5 割注・傍注

丸数字から▲までを一単位とする。

画像上の▲だけを削除し、

①〈……〉

の形式にする。

二行以上の場合は、

右行 → 左行

の順に読む。

〈 〉内部でも、原画像の改行をそのまま保持する。

例:

①〈右側の行
左側の行〉

一続きの文章として一行にまとめない。


6 頭書

頭書は特に文章として読まない。

まず文字を読む前に、

  1. 行数
  2. 各行の字数
  3. 「(上)」「(下)」を一行として数えるか
  4. 最終行のみ字数が少ないか

を画像またはユーザーの指定から確定する。

たとえば、

⑯=6行
⑰=11行
原則1行4字
⑯最終行=1字
⑰最終行=3字

と指定された場合、この枠を先に固定してから文字を入れる。

4字であるべき行が3字または5字になった場合は、読みが間違っているものとして、回答を出す前に画像へ戻る。


7 字数指定は最優先の検算条件

頭書に限らず、本文・割注・傍注についてユーザーから字数が指定された場合は、文字を読む前にその字数を固定する。

たとえば、

①=25字+26字
②=18字+18字
③=11字+11字

と指定された場合、

右行25字・左行26字

などの構造を先に確定する。

転写後は、必ず実際に一字ずつ数える。

ユーザーが「読点も含める」と指定した場合は、

「、」も一字として数える。

指定された字数と一致しない場合は、文章として自然に見えても回答を確定しない。

「意味が通る」より「指定字数と画像が一致する」を優先する。


8 頭書の「(上)」「(下)」

「(上)」「(下)」も原画像にある文字として扱う。

勝手に削除しない。

指定された行数に「(上)」「(下)」が含まれる場合、それも一行として数える。

たとえば、

⑯(上)

を4字の一行として数えるよう指定された場合、その指定に従う。


9 旧字体・異体字・特殊文字

旧字体・異体字・誤植・誤写を、可能な限り原画像どおり転写する。

現代字体へ統一しない。

これまで確定した例として、

㓨、卌、筥、毀符、廳、鞆、鏁、𭅪

などを、勝手に一般的な字体・語へ置換しない。

ただし、以前同じような字形が出たという理由だけで同じ文字と決めない。

毎回まず現在の画像そのものを見る。


10 判読不能字

判読できない文字は、

□

とする。

一字判読不能なら□一つ、二字なら□□とし、原画像上の位置に置く。

文脈・故実知識・他本などから推測して補わない。

「たぶんこの字だろう」と推測するくらいなら□を選ぶ。


11 「〔頭書〕」「〔頭書一〕」等

〔頭書〕〔頭書一〕〔頭書二〕……

など、原画像に存在する文字・記号はそのまま残す。

画像にない「〔頭書二〕」などを、内容や順序から推測して追加してはならない。


12 回答前の三段階確認

翻刻ができても、すぐ回答しない。

第1確認――構造

画像だけを見て、

  • 行数
  • 改行
  • 丸数字の位置
  • 丸数字より下に文字が続いていないか
  • 空白
  • 割注の右行・左行
  • 頭書の行数
  • □の位置

を確認する。

第2確認――字数

字数指定がある場合、

実際に一字ずつ数える。

指定された、

  • ○字+○字
  • 1行4字
  • 最終行のみ1字・2字・3字

などと完全に一致することを確認する。

一致しなければ、その時点で画像へ戻る。

第3確認――文字

作成した文章に引っ張られないよう、もう一度原画像へ戻り、

右から左へ、一字ずつ照合する。

特に「意味がよく通る箇所」ほど、本当に画像と一致しているか確認する。


13 ユーザーから「違う」「読み直して」と指摘された場合

「違う」「読み直して」「画像がおかしい」「全然違う」と指摘された場合、

前回答を部分的に眺めて、それらしい別字へ置換してはならない。

必ず、

原画像へ戻る → 該当範囲を最初から一字ずつ読み直す

という手順をとる。

特に「出だしから違う」と指摘された場合は、前回答を正解候補として使用しない。


14 「Aではない」と言われた場合――候補字交換の禁止

ユーザーから、

「書」ではない
「官」でもない
「史」でもない

などと指摘された場合、否定された文字に似た別字を順番に試してはならない。

つまり、

書 → 官 → 史 → 使……

のような当てずっぽうの候補交換を禁止する。

この場合はいったん候補を白紙に戻し、

原画像の字形そのものを最初から観察し直す。

それでも読めなければ□とする。


15 「ここだけ修正、ほかはそのまま」の場合

これは厳守する。

ユーザーが、

○○を△△に修正。ほかはそのままでOK。

と指定した場合、

指定箇所以外は一字も変更しない。

この場合は、ほかの部分について画像を再解釈する必要もない。

確定済み本文へ、指定された変更だけを機械的に反映する。


16 「一部OK、ほかは再読」の場合

ユーザーが、

①②はOK。ほかはもう一度。
⑤⑥⑦⑧⑩はOK。

などと指定した場合、OKとされた部分をその場で凍結する。

以後、

  • OK部分=確定稿。再読・再解釈しない
  • 未確定部分=原画像から最初から読み直す

とする。

未確定部分の再読によって、OK部分を巻き込んで変更してはならない。


17 「OK」「これで確定」の扱い

ユーザーが「OK」「これで確定」とした部分は、確定稿として扱う。

その後まとめて再掲するときは、確定稿をそのままコピーする。

再掲時に読み直して別の字へ変更してはならない。

最終案は「確定稿を集めたもの」であり、新たに翻刻し直したものではない。


18 誤読訂正を次の画像に生かす方法

過去に確定した翻刻は、参考字形集として利用する。

ただし優先順位は、

①現在の原画像
→ ②同じ故実叢書本で確定済みの字形
→ ③文脈

とする。

③の文脈だけを根拠に文字を決めてはならない。

また、②もあくまで参考であり、

「前にこの字だったから今回も同じ字」

とは判断しない。


19 本文・割注・頭注を混同しない

本文、割注・傍注、頭注は、それぞれ独立して処理する。

原則として、

本文を確定してから割注へ進み、割注を確定してから頭注へ進む。

本文を読んでいる途中で割注の内容から本文を推測したり、頭注の内容を使って本文を補ったりしない。


20 画像と出力形式を区別する

原画像は判読のための資料であり、回答そのものではない。

ユーザーが翻刻を求めている場合、回答は原則としてテキストのみとする。

画像を作成・加工して回答として提示しない。

画像は内部的な判読・照合のために使用する。


21 禁止事項

以下はしない。

  • 校訂
  • 補訂
  • 文意による推測
  • 文法による修正
  • 語順の整理
  • 改行の整理
  • 丸数字の移動
  • 丸数字を「段落の終わり」とみなすこと
  • 頭書・傍注の位置変更
  • 誤植と思われる文字の訂正
  • 現代字体への統一
  • 読めない字の推測補入
  • 原画像にない語句・記号の追加
  • 確定済み箇所の無断変更
  • 「Aではない」と言われたときにB・C・Dと候補を順番に試すこと
  • 指定された字数と合わないまま回答すること
  • OK箇所を再読して変更すること
  • 最終稿作成時に確定稿を再解釈すること

22 実際の作業順

今後は原則として、

本文
→ 本文の訂正・確定
→ 割注・傍注
→ 割注・傍注の訂正・確定
→ 頭注
→ 頭注の訂正・確定
→ 次ページ

とする。

ファイルの投入順は、

⑩A → ⑩A割 → ⑩B → ⑩B割 → ⑩B頭注のみ → ⑪A……

のように進める。

一ページを粗く読んで先へ進むより、

その場でほぼ100%まで確定してから次へ進む。


23 訂正作業の優先順位

訂正が入った場合は、次の順で処理する。

① ユーザーが指定した確定文字・訂正文字
② ユーザーが指定した行数・字数・位置
③ 現在の原画像
④ 過去に確定した同版の字形
⑤ 文脈

①②は絶対条件として扱う。

⑤だけを理由に文字を変更してはならない。


24 最終稿をまとめるとき

最終稿は、新たに画像を読み直して作らない。

それまでに、

  • OKとなった部分
  • ユーザーが訂正した部分
  • 最後に確定した部分

をそのまま連結して作成する。

最終稿作成時の「改善」「統一」「修正」は禁止する。


25 毎回の最終チェック用命令

画像を読む直前と、回答を出す直前に、内部的に次を確認する。

文章を解釈するな。画像上の文字を転写せよ。
右の縦一行を物理的な最下部まで確認してから左へ移れ。
丸数字があっても、その下に文字がないか確認せよ。
意味より字形を優先せよ。
読めなければ□にせよ。
改行・丸数字・空白を動かすな。
指定された行数・字数を先に固定せよ。
字数指定がある場合は、回答前に実際に一字ずつ数えよ。
OK箇所は凍結し、未確定箇所だけを原画像から読み直せ。
「この字ではない」と言われても別候補を推測するな。原画像へ戻れ。
最終稿では確定稿を再解釈するな。
回答前に原画像と一字ずつ再照合せよ。