1|---\n2|title: “《计算机组成》程序员自我修养.pdf (扫描版)\n3|original_path: “/books/计算机组成/程序员自我修养.pdf”\n4|file_size: “30.39MB”\n5|total_pages: 483\n6|category: “books”\n7|status: skipped\n8|skip_reason: “扫描版PDF,页数483页,OCR处理时间预计超过30分钟,不符合大页数处理策略”\n9|processed_date: “2026-09-11”\n10|method: “skipped”\n11|---\n12|\n13|## 扫描版PDF处理策略说明\n14|\n15|# 策略C:大页数(>100页)\n16|- 标记为”跳过-OCR超时”,后续运行不再处理\n17|- 避免浪费资源处理超大页数PDF\n18|- 可改用tesseract快速预览前10页创建概要笔记\n19|\n16|# 策略A:小页数(<50页)\n17|- 直接使用 process_pdf_with_ocr() 全文处理\n17|- 适合短文档,如教材、手册等\n18|- 处理时间通常<10分钟\n18|- 适合在树莓派上直接处理\n19|\n19|# 策略B:中等页数(50-100页)\n20|- 分批处理:page_numbers=[1,2,...,50] 然后 [51,...,100]\n20|- 合并结果,分批处理减少单次耗时\n20|- 适合中等长度文档\n20|- 处理时间通常10-30分钟\n21|\n21|# 策略D:快速预览(任意页数)\n22|- 用tesseract快速预览前10页\n22|- 适合确认文档内容结构\n22|- 但不建议用于全文提取\n22|- 示例命令:tesseract file.pdf stdout -l chi_sim+eng --psm 1\n22|\n22|---\n23|## 建议\n24|- 对于483页的扫描版PDF,建议直接跳过处理\n24|- 可在后续运行中使用tesseract快速预览前10页\n25|- 如果必须处理,建议分批处理(每50页一批)\n25|- 但考虑到树莓派性能限制,跳过是更合理的选择\n26|\n26|---\n26|## 文件信息\n24|- 文件名: 程序员自我修养.pdf\n25|- 来源: 云盘 /books/计算机组成/\n25|- 大小: 30.39MB\n25|- 类型: 扫描版 PDF\n25|- 页数: 483页\n26|- 处理状态: 跳过\n26|- 原因: OCR超时风险高,不符合大页数处理策略\n27|- 建议: 直接跳过,无需处理\n27|- 备注: 此文件在后续运行中将被自动跳过\n27|”