Repository navigation
Conversation
…זה Suggestions במסלול ה-Markdown (#3426) - `candidates` היה השדה היחיד בתשובת `codekeeper_docs_get_section` בלי תקרה: `toc` חסום ב-400, `suggestions` ב-50, ורק המועמדים חזרו כולם — נמדד בסקירת #3425: 13,030 מועמדים ו-1,393,787 בתים על שאילתה בת שלושה תווים בעמוד סינתטי של 512KB. הענף נדלק מכותרות שנושאות מזהה, ומאז #3428 הקורפוס שנושא אותם (amir-bug-patterns) מוגש. - התקרה היא 50 — אותו מספר כמו MAX_IDENTIFIER_SUGGESTIONS ומאותה סיבה (מלאי בסדר הופעה ולא דירוג, גבוה מספיק שכל עמוד אמיתי ייענה במלואו), והשוויון מקובע בטסט. `candidates_truncated: true` מופיע רק כשנחתך, כמו `suggestions_truncated`: תצלום אפס-הדיף של הכלי על קורפוס ה-RST של main זהה בית-בית לפני ואחרי (5,928 רשומות, אותו sha256). - R6: החיתוך של `toc` ושל `candidates` עובר דרך עוזר אחד, `_capped`, במקום עותק שני של "עד התקרה, ודגל רק כשנחתך". - הצרכן השני מ-#3426 הוא בפועל אותו אתר קריאה לשני הפורמטים (מאז #3428), והוא כותב `.titles`; נוסף טסט שמקבע את זה במסלול ה-Markdown, כי אזהרה ב-docstring אינה מנגנון. - תיאור הפרמטר `section` ו-docs/mcp-server.rst אומרים את התקרה והדגל; רשומה ב-whats-new. שורה ריקה אחת נוספה ב-server.py לפני `_build_docs_path_doc` (E302 שהגיע עם #3428; CI בוחר רק E9/F63/F7/F82 ולכן לא נפל שם). טסטים: 135 ב-test_mcp_docs_handlers + test_doc_sections ו-36 ב-test_mcp_server_build ירוקים; טסט התקרה וטסט השוויון נופלים על origin/main ב-worktree נפרד. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx
|
ⓘ Qodo reviews are paused because your trial has ended. Ask your workspace admin to add credits to resume reviews. Manage billing |
There was a problem hiding this comment.
Sorry @amirbiron, you've used your own review budget of 250,000 diff characters for the last 7 days.
You can request another review in 1 hour and 22 minutes by commenting @sourcery-ai review. Upgrade to get a review now.
|
You have reached your Codex usage limits for code reviews. You can see your limits in the Codex usage dashboard. |
Reviewer's GuideThis PR bounds ambiguous_section candidate lists to 50 entries, reports candidates_truncated only when candidates are actually omitted, and consolidates truncation behavior while adding regression tests for both the new contract and Markdown suggestion serialization. Documentation and tool descriptions are updated, with corpus-level zero-diff validation intended to confirm no changes to unaffected responses. Sequence diagram for capped ambiguous section candidatessequenceDiagram
participant Client
participant DocsHandler as docs_handlers
participant Document
Client->>DocsHandler: docs_get_section(section)
DocsHandler->>Document: find matching sections
Document-->>DocsHandler: matches
alt multiple matches
DocsHandler->>DocsHandler: _capped(matches, _CANDIDATES_MAX)
DocsHandler-->>Client: ambiguous_section with up to 50 candidates
opt more than 50 matches
DocsHandler-->>Client: candidates_truncated: true
end
end
File-Level Changes
Possibly linked issues
Tips and commandsInteracting with Sourcery
Customizing Your ExperienceAccess your dashboard to:
Getting Help
|
🧯 Dangerous deletes guard reportPolicy: see .cursorrules — dangerous deletions are blocked unless wrapped safely. Summary:
Flagged findings (file:line:snippet): Excluded matches (by path pattern) |
|
No actionable comments were generated in the recent review. 🎉 ℹ️ Recent review info⚙️ Run configurationConfiguration used: Organization UI Review profile: CHILL Plan: Advanced Run ID: 📒 Files selected for processing (5)
Included review availability: Your plan provides up to 1 included review per hour; 0 remain after this review. 📝 WalkthroughWalkthroughהעדכון מגביל את Changesהגבלת מועמדים בזרימת החיפוש
Priority: ➖ Normal Estimated code review effort: 2 (Simple) | ~10 minutes Change: Bug fix · Severity of issue fixed: Medium 🚥 Pre-merge checks | ✅ 4 | ❌ 1❌ Failed checks (1 warning)
✅ Passed checks (4 passed)
Full details: Docstring CoverageExplanation Docstring coverage is 54.55% which is insufficient. The required threshold is 80.00%. Docstring coverage is scoped to functions touched by this diff. Analyzed 11 functions across 3 files. (2 skipped: 2 unsupported.)
✨ Finishing Touches 💡 1📝 Generate docstrings 💡
🧪 Generate unit tests (beta)
Thanks for using CodeRabbit! It's free for OSS, and your support helps us grow. If you like it, consider giving us a shout-out. חמישים מועמדים עומדים בשורה, Comment |
⏱️ Performance report(No performance test durations collected. Mark tests with |
📖 Documentation PreviewThe documentation has been built successfully!
To view locally:
|
Codecov Report✅ All modified and coverable lines are covered by tests. 📢 Thoughts on this report? Let us know! |
… סקירת שבעת ה-PRים (#3434–#3441) (#3443) * fix(mcp): תקרה לרשימת המועמדים של ambiguous_section, וטסט שמקבע את חוזה Suggestions במסלול ה-Markdown (#3426) - `candidates` היה השדה היחיד בתשובת `codekeeper_docs_get_section` בלי תקרה: `toc` חסום ב-400, `suggestions` ב-50, ורק המועמדים חזרו כולם — נמדד בסקירת #3425: 13,030 מועמדים ו-1,393,787 בתים על שאילתה בת שלושה תווים בעמוד סינתטי של 512KB. הענף נדלק מכותרות שנושאות מזהה, ומאז #3428 הקורפוס שנושא אותם (amir-bug-patterns) מוגש. - התקרה היא 50 — אותו מספר כמו MAX_IDENTIFIER_SUGGESTIONS ומאותה סיבה (מלאי בסדר הופעה ולא דירוג, גבוה מספיק שכל עמוד אמיתי ייענה במלואו), והשוויון מקובע בטסט. `candidates_truncated: true` מופיע רק כשנחתך, כמו `suggestions_truncated`: תצלום אפס-הדיף של הכלי על קורפוס ה-RST של main זהה בית-בית לפני ואחרי (5,928 רשומות, אותו sha256). - R6: החיתוך של `toc` ושל `candidates` עובר דרך עוזר אחד, `_capped`, במקום עותק שני של "עד התקרה, ודגל רק כשנחתך". - הצרכן השני מ-#3426 הוא בפועל אותו אתר קריאה לשני הפורמטים (מאז #3428), והוא כותב `.titles`; נוסף טסט שמקבע את זה במסלול ה-Markdown, כי אזהרה ב-docstring אינה מנגנון. - תיאור הפרמטר `section` ו-docs/mcp-server.rst אומרים את התקרה והדגל; רשומה ב-whats-new. שורה ריקה אחת נוספה ב-server.py לפני `_build_docs_path_doc` (E302 שהגיע עם #3428; CI בוחר רק E9/F63/F7/F82 ולכן לא נפל שם). טסטים: 135 ב-test_mcp_docs_handlers + test_doc_sections ו-36 ב-test_mcp_server_build ירוקים; טסט התקרה וטסט השוויון נופלים על origin/main ב-worktree נפרד. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * fix(mcp): תקרת גודל לגוף בקשה והגבלת קצב לפי זהות, עם סירוב שנוקב בסיבתו (#3431) עד היום המידלוור היחיד בשרת ה-MCP היה האימות: כל משתמש מאומת יכול היה לשלוח בקשות בכל גודל ובכל תדירות. שני גבולות חדשים, כל אחד בשכבה שלו, במודול חדש mcp_server/limits.py: - גודל הגוף: מידלוור ASGI טהור (BodySizeLimitMiddleware) שמסרב ב-413 {"error": "body_too_large", "max_bytes": ...} לפני שהטרנספורט של ה-SDK קורא ומפענח JSON. Content-Length שמצהיר על יותר מהתקרה נדחה לפני שנקרא בית אחד; כותרת חסרה או מכזבת נתפסת בספירה של מה שבאמת מגיע. חיץ ולא חריגה מתוך receive, כי _handle_post_request של ה-SDK עוטף את קריאת הגוף ב-try שתופס Exception ומחזיר שגיאת JSON-RPC בלי סיבה. ברירת המחדל 1MiB, נגזרת מ-MAX_CODE_SIZE (100,000 תווים, עד ~600KB כ-JSON עם ensure_ascii). - קצב לפי זהות: ב-AdminAwareFastMCP.call_tool, המתודה שה-SDK רושם כמטפל של tools/call, כלומר נקודה אחת שכל קריאת כלי עוברת בה בשני מצבי האימות (במצב OAuth PATAuthMiddleware אינו מותקן, ורק הקונטקסט של הקריאה רואה את הזהות). ההכרעה נופלת לפני שגוף סינכרוני נמסר לחוט ולפני שגוף אסינכרוני רץ; קריאה שנדחתה מחזירה תשובת כלי רגילה {"ok": false, "error": "rate_limited", "limit_per_minute": ..., "retry_after_seconds": ...}. מחוץ לבקשה (LookupError מ-request_context) אין את מי לחייב, ולכן הטסטים שקוראים לכלים ישירות ממשיכים כמו היום. 60 בדקה, מהמדידות בתגובה באישו: 0.24 שניות מעבד לעמוד RST עוין של 500KB, 0.47 למסמך Markdown הצפוף, 2.3 לצורה העוינת, מול מכסה של 0.5 מעבד (30 שניות-מעבד בדקה). - הפטור לנתיבי הדופק מבני ולא רשימה (blanket-policy-silent-block §7): /healthz אינו קריאת כלי ואין לו גוף, ומקובע בטסט על האפליקציה האמיתית. - rate_limiter.RateLimiter הקיים של הבוט משמש כמנוע (R6): ניקוי החלון אוחד ל-_live_entries, ונוספה seconds_until_allowed בשביל retry_after_seconds. - כיוון דרך MCP_MAX_REQUEST_BYTES (מינימום 65536) ו-MCP_RATE_LIMIT_PER_MINUTE (0 מכבה במפורש עם WARNING), נקראים ב-create_app ולא בזמן ייבוא; ערך פגום לעולם אינו מרחיב את הגבול (K12 §3). נרשמו ב-config_inspector_service ובתיעוד. אומת עם uvicorn אמיתי: 401 לפני 413 במצב PAT, 413 על Content-Length ועל גוף chunked בלי כותרת, 120 דגימות של /healthz תחת מגבלה של קריאה אחת בדקה כולן 200; ועם לקוח ה-MCP של ה-SDK על Streamable HTTP: הקריאה השנייה מחזירה rate_limited ו-tools/list אחריה עדיין עונה. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * fix(parsers): rst_parser בודק את הקלט בכניסה, וברירת המחדל של max_sections מיושרת ל-MAX_SECTIONS (#3421, #3420) שני הפארסרים מתועדים כבני-החלפה, ועל קלט שאינו מחרוזת הם התנהגו אחרת: rst_parser.parse_document(None) החזיר מסמך ריק בשקט (מפה ריקה שמתחזה למפה של קובץ בלי כותרות), ו-17 נפל ב-AttributeError גולמי מתוך .replace, בעוד md_parser זרק TypeError שאומר מה התקבל. וברירת המחדל של max_sections הייתה None ב-rst_parser ו-MAX_SECTIONS ב-md_parser, כלומר קורא ששכח להעביר תקרה קיבל הגנה מהפארסר האחד ולא מהשני. - #3421: בדיקת כניסה אחת לשניהם, doc_sections.require_str, שמרימה TypeError עם אותן מילים ("parse_document expects str, got NoneType"). אף קורא לא נשען על הצורה הישנה: המטפל, הסורק והסקריפטים מעבירים תמיד מחרוזת. docs_get_section אינו תופס את החריגה, כמו שלא תפס אותה מ-md_parser: "חוזה נשבר" ולא "הקלט נדחה", ו-content שם תמיד מחרוזת. - #3420, ההכרעה: יישור. MAX_SECTIONS עובר ל-services.doc_sections (המודול המשותף), מיוצא מחדש משני הפארסרים, והוא ברירת המחדל בשניהם. נמדד לפני השינוי על כל 208 קובצי ה-RST ב-docs/: 1,384 סקשנים בסך הכול, הקובץ העשיר ביותר (docs/mcp-server.rst) נושא 50 מול תקרה של 50,000, אחד לאלף, ואף קובץ אינו נחסם. אפס-דיף על docs_get_section: 5,931 רשומות זהות בית-בית לפני ואחרי על אותו קורפוס. - בעקבות היישור docs_get_section אינו מעביר תקרה לאף פארסר (עד עכשיו העביר ל-rst_parser את _ceiling.MAX_SYMBOLS במפורש, כי ברירת המחדל שם הייתה None), ו-"max" בסירוב הוא doc_sections.MAX_SECTIONS, המספר שהפרסר באמת השתמש בו. הייבוא של _ceiling מהמטפל הוסר. - outline_scanners/rst.py ממשיך להעביר את _ceiling.MAX_SYMBOLS במפורש (המספר של המפה, כותרות ותוויות יחד), וטסט חדש מקבע זאת: מוטציה שמוחקת את הארגומנט מפילה אותו. - scripts/measure_md_parse_cost.py: שלוש הצורות רצות עכשיו על ברירת המחדל בשני הפרסרים, כמו הכלי; מתועד בדוקסטרינג, והסקריפט רץ מקצה לקצה. טסטים: 12 טסטים חדשים או שנערכו נופלים על origin/main; הפין של הסורק עובר שם בכוונה. שלוש מוטציות ב-worktree (הסורק בלי הארגומנט, המטפל שמעביר תקרה שוב, require_str שממיר None ל-"") מפילות כל אחת את הטסט שלה. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * fix(mirror): get_file_at_commit בודק את גודל האובייקט לפני git show, וקובץ מעל התקרה אינו נטען כלל (#3433, פריט 9) עד היום git show נטען כולו לזיכרון (capture_output=True) ורק אז max_size נבדק, כלומר התקרה הייתה בדיקה בדיעבד ולא חסם על הזיכרון: קובץ של 12MB שנדחה עלה 20MiB שיא בחוט הקריאה לפני שהתשובה הייתה file_too_large. זה השורש של WARN-003 בסקירת #3429, ומה שהניח את "קריאה אחת עולה לכל היותר X" כהערה ולא כתכונה של הקוד. - _object_size: git cat-file -s <sha>:<path> מחזיר את גודל האובייקט מהמאגר בלי לקרוא אותו. שתי הפקודות פונות לאותו sha שנפתר פעם אחת ב-_validate_ref_with_git, ולכן אין חלון בין הבדיקה לקריאה שסנכרון של המראה יכול להיכנס בו (TOCTOU נבחן ונדחה: אובייקט בקומיט נתון אינו משתנה). - כשל בבדיקת הגודל הוא סירוב באותה מפה של git show, לא נפילה לקריאה בלי תקרה; פלט שאינו מספר הוא כשל ולא אפס (U3). מיפוי ה-stderr אוחד ל-_object_read_error, כי git 2.43 מדפיס את אותן הודעות לשתי הפקודות על נתיב חסר ועל קומיט שאינו מכיל אותו (נמדד). - החסם על מה שמוחזר נשאר: לנתיב של תיקייה cat-file -s מודד את אובייקט העץ ואילו git show מדפיס רשימה, ומה שחוזר לעולם אינו גדול מ-max_size. - אותה תשובה ואותו size בסירוב (גודל הבלוב), ואותה תשובה מתחת לתקרה. נמדד (VmHWM, תהליך נקי, מראה bare עם קבצי טקסט): 12MB מול תקרה של 500KB ושל 10MiB — 20.2 ו-20.4MiB שיא לפני, 0.0 אחרי; 7MB מתחת לתקרה — 14.2 לפני ו-14.5 אחרי, כי אותו כן קוראים. טסטים על מראה git אמיתית ב-tmp_path עם מרגל על subprocess.run: ארבעה נופלים על origin/main (הסירוב לפני git show, אותו sha לשתי הפקודות והסדר ביניהן, כשל בבדיקה שאינו נופל לקריאה, גודל שאינו מספר), ושלושה עוברים שם בכוונה כבקרות (מתחת לתקרה, נתיב חסר, החסם על מה שמוחזר); מוטציה שמוחקת את החסם השני מפילה את הפין שלו. התיעוד וההערות שתיארו את "טוענת את ה-blob כולו לפני בדיקת הגודל" עודכנו. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * chore(mcp): ארבעה פריטים קטנים מסקירת #3429 — SUGG-014, SUGG-001, SUGG-004, SUGG-010 (#3433) - SUGG-004: שורת הקיבולת קוראת את ThreadPoolExecutor._max_workers הפרטי דרך _installed_width, וכשהמאפיין ייעלם היא מדפיסה את הרוחב שהתבקש עם "(requested; installed width unreadable)" ו-WARNING שאומר למה — במקום שהשירות לא יעלה בגלל שורת לוג, ובמקום להדהד את הבקשה כאילו היא המצב (state-record-without-state-change). אותו כלל גם ב-WARNING של ה-fallback. - SUGG-010: md_parser.token_count — פונקציה ציבורית ומתועדת שסופרת טוקנים על _MD, המופע שהכלי מריץ — במקום שהסקריפט יקרא ל-_build_parser הפרטית ויבנה פרסר חדש לכל קובץ. מחוץ ל-__all__ בכוונה: הרשימה שם היא החוזה של "שני פארסרים בני-החלפה", וטסט מקבע את ההפרש בינה לבין זו של rst_parser. - SUGG-014: שני טסטים לקובץ memory.max שקיים אבל ריק (IndexError) או לא-מספרי (ValueError) — שניהם נופלים ל-cgroup v1 ומחזירים את הערך שלו. כיסוי השורות היה מלא; התרחיש חסר. מוטציה שמסירה כל אחת מהחריגות מה-except מפילה את הטסט שלה. - SUGG-001: האסרשן שלא יכול היה ליפול הוחלף: os.cpu_count מוצמד ל-16 כדי ש"cpu_count + 4" יהיה 20, מספר שהרצפה לעולם אינה — ומוטציה שמחזירה את ה-fallback ל-min(32, cpu_count + 4) מפילה אותו. על origin/main: שלושה טסטים נופלים (הרוחב הלא-קריא, token_count, הסקריפט דרך הפונקציה הציבורית); שלושת האחרים עוברים שם ומוכחים במוטציות. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * refactor: שלושה כללים שנכתבו פעמיים חזרו למקום אחד — CR בודד, גבול front matter, תווים נסתרים (#3419, #3427) - כלל ה-\r הבודד (סיומת שורה שאינה חד-משמעית) ישב גם ב-mcp_server/outline.py וגם ב-services/md_parser.py, ושני העותקים היו צריכים להסכים לנצח (R6). עכשיו הוא במודול עלה חדש, services/line_endings.py (CR_WITHOUT_LF, find_lone_cr), ושני הצרכנים קוראים לו; הכיוון חד-סטרי (mcp_server מייבא מ-services). טסט מוכיח מול markdown-it-py שהכלל נכון, וטסט מבני מוכיח ששני הצרכנים מייבאים אותו ואף אחד מהם אינו מחזיק עותק. - scripts/generate_ai_map.py::_body_start כתב ביד את גבול ה-front matter, ונמדד ב-#3418 שהוא חולק על התוסף ש-MyST מריץ בחמש מתוך שתים-עשרה צורות. עכשיו הוא קורא את הגבול מהפארסר של הכלי — md_parser.front_matter_end, דרך mdit_py_plugins.front_matter על אותו מופע — והסקריפט מוסיף את שורש הריפו ל-sys.path כדי לרוץ לבדו כמו קודם. אפס-דיף: AI-MAP.md שנוצר זהה בית-בית לזה שבריפו (וגם לפלט הקוד הישן). הטסט שקיבע את הפער בכוונה (test_the_front_matter_rules_still_disagree_as_measured) נערך יחד עם הסגירה, כפי שה-docstring שלו דרש: הטבלה נשארה עם עמודת אמת אחת (התוסף), ושני הקוראים נבדקים מולה; הטסט שהצמיד את המספר "חמש מתוך שתים-עשרה" לפרוזה הוסר יחד עם הפער, והפרוזה (md_parser, requirements/base.txt) מספרת עכשיו את ההיסטוריה. - #3427: known_hex4 (utils) ו-_KNOWN_ESCAPE_HEX4 (CodeNormalizer) — שתי רשימות זהות של 16 קודים שנבדקו לפני בדיקת הקטגוריה, וכל 16 הם Cf, כלומר הרשימה לא הוסיפה דבר. שתיהן נמחקו, ושתי הפונקציות אוחדו ל-strip_hidden_escapes אחת בשכבת הדומיין (טהורה, בלי I/O); utils.normalize_code מייבא אותה במפורש (הייבוא האופציונלי של הדומיין הפך לייבוא רגיל — מסלול ישן שרץ בלעדיו היה עותק שני מחדש). ענף ה-Variation Selectors (Mn, לא Cf) נשאר נפרד ונדלק רק עם remove_variation_selectors=True, כמו קודם. אפס-דיף מדוד: 39 קלטים של רצפי בריחה × 6 צירופי אפשרויות, שני הנרמולים, זהים לפני ואחרי. טסטים: מה שנוגע בשמות החדשים נופל על origin/main (line_endings, front_matter_end, strip_hidden_escapes); טסטי ההתנהגות עוברים שם בכוונה (אפס-דיף) ומוכחים במוטציות — בדיקת הקטגוריה שנמחקת מפילה את 16 טסטי הקודים, ועותק פרטי של כלל ה-CR בפארסר מפיל את הטסט המבני. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * chore(mcp): יתרת ממצאי הסקירה על #3428 — שני סירובים בשמם, טבלאות קפואות, זנב תשובה נפרד, וטסטים שחסרו (#3432) שמונה מאחת-עשרה ההצעות ממומשות, שלוש מוכרעות במפורש: - SUGG-013: path_outside_root — נתיב תקין בצורתו שפותר אל מחוץ לשורש התיעוד (docs/../secrets, /etc/hosts, ../README.md בשורש ריק) נדחה בשמו, עם root בתשובה; missing_path נשאר לנתיב ריק או עם NUL בלבד. - SUGG-011: repo_not_mirrored — מראה שאין למארח (repo_not_found מהשירות) אינה not_found; invalid_commit נשאר not_found (הריפו קיים, ה-ref הוא מה שהקורא יכול לשנות); בזמן sync שניהם sync_in_progress כמו קודם. עובר גם דרך codekeeper_docs_get_section עם repo ו-path. - SUGG-021: _PARSERS ו-DOCS_PATH_POLICY מיוצאים כ-MappingProxyType — הוולידציה בייבוא היא הבטחה רק אם הטבלה אינה משתנה אחריה; _PARSER_TABLE ו- _DOCS_PATH_POLICY_TABLE הם התפר לטסטים (monkeypatch.setitem). - SUGG-020: זנב עיצוב התשובה של docs_get_section נפרד ל-_answer_from_document (ארבע צורות התשובה מתוך מסמך שכבר נפרסר). אפס-דיף: 5,935 רשומות על אותו קורפוס, 5,933 זהות בית-בית; השתיים ששונות הן בדיוק שני הפרובים של SUGG-013 (missing_path ← path_outside_root). - SUGG-009: חמישה טסטים לשתי בדיקות הנרמול ב-_validate_policy_tables (סיומת ברישיות/בלי נקודה, שורש מוחלט/עם לוכסן סוגר/עם ./). - SUGG-010: טסט caplog לשורת ה-WARNING על repo_not_configured. - SUGG-004: טסט ההסכמה בין חיפוש לקריאה אינו דורש עוד returned == allowed — repo_policy מצהיר ש-is_denied נשאר שכבה אחרונה, ושוויון מדויק דרש את ההפך; נשאר "אפס חסומים בתוצאות" + "הקובץ המותר כן חוזר" נגד ריקנות. - SUGG-005: _require_git אחד לשני הטסטים תלויי-git — דילוג בלי הבינארי במקום skip באחד וקריסה על check=True בשני. - SUGG-022 (הכרעה, מתועדת ב-docs/mcp-server.rst): סירוב הוא תשובה של הפרוטוקול ולא תקרית; אף מסלול סירוב בשכבת המטפלים אינו רושם שורה, בכל הקבצים באותה מידה; לוג למה שהמפעיל צריך לדעת, תשובה למה שהקורא צריך; ספירת סירובים — ב-PostHog. - SUGG-012 (נדחה בנימוק): תצוגת התצורה ב-services אינה יכולה לייבא את mcp_server.docs_handlers — הכיוון חד-סטרי ומוצהר בכמה מקומות; התקלה כבר קולנית בזמן ריצה (WARNING לכל קריאה + repo_not_configured). - SUGG-018 (נדחה בנימוק): שני חצאי מדיניות הסודות נשארים בשתי שפות כי אין מנוע אחד לשניהם; מה שמחזיק אותם יחד — רשימת תבניות אחת, טסט אינטגרציה על מראה אמיתית, וטסט ישיר על ארבע הצורות. טסטים: 17 נופלים על origin/main (הקודים החדשים, הפרוקסי, הוולידטור, המראה החסרה), 7 עוברים שם כפינים ומוכחים במוטציות — מחיקת ה-WARNING, טבלאות כ-dict רגיל, ומחיקת בדיקת הסיומת מהוולידטור מפילות כל אחת את הטסט שלה. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * fix(mcp): תקרת הגוף מפסיקה לקרוא גוף אנונימי לפני האימות, ויתרת ממצאי סקירת שבעת ה-PRים סגירת הממצאים מסקירת Han על #3434–#3441 (הדוח: code-review-7prs-3434-3441.md ב-CodeKeeper). SEC-001 (רגרסיה של #3431), שלושה חלקים, כל אחד עם טסט שנפל לפני התיקון: - Content-Length תקין (ספרות ASCII, בלי Transfer-Encoding) עובר בלי קריאה — השרת תוחם את הגוף. נמדד על האפליקציה במצב OAuth: 5 קריאות receive() לפני ה-401 → 0. - גוף בלי אורך מוצהר נקרא עד התקרה תחת דדליין של 30 שניות על הלולאה כולה (anyio.fail_after), ואז 408 body_read_timeout עם כמה נקרא. נמדד מול uvicorn אמיתי: לפני — אין תשובה אחרי 35 שניות; אחרי — 408 אחרי 30.005 שניות, Connection: close, והשרת סוגר את החיבור. - רק POST/PUT/PATCH נבדקות (WARN-002): GET /healthz עם Content-Length מזויף מחזיר 200 במקום 413, בשני מצבי האימות. שני הסירובים נושאים Connection: close. טסט סדר-התקנה למצב OAuth לצד זה של מצב PAT, ותיקון המשפט "הפטור מבני" בתיעוד, ב-docstring ובהערה. WARN-001: טסט בתת-תהליך שמייבא את mcp_server.app כמו uvicorn, בשני המצבים, עם ריצת בקרה — שני משתני הסביבה ו-MAX_CODE_SIZE מגיעים לאפליקציה הבנויה. WARN-003: הוחלט — התיעוד אומר שסירובי מכסה אינם נספרים ב-PostHog (ואף סירוב אינו נספר לפי סוג), והעיצוב פתוח באישו #3442. WARN-004: הצורה העוינת במדידת הפרסור רצה עם max_sections=None במפורש. הצעות שנכנסו: SUGG-022 (התקרה נגזרת מ-MAX_CODE_SIZE ב-request_bytes_for, גם בעליית השירות; טסט מצמיד ומודד שקובץ עברי מקסימלי נכנס), SUGG-009 (הסירוב הוא CallToolResult שלם — כלי עם טיפוס החזרה ושם לא מוכר מקבלים rate_limited), SUGG-023 (is None במקום or), SUGG-024 (25 קריאות מקבילות, תקציב 2 — בדיוק 2 עוברות), SUGG-011 (RateLimiter אינו יוצר רשומה לשאלה בלבד; פנקס האזהרות מנוקה), SUGG-019 (token_count ו-front_matter_end עוברים בשער הכניסה של parse_document), SUGG-013, SUGG-002, SUGG-020, SUGG-021, SUGG-005, SUGG-006, SUGG-010, SUGG-001. YAGNI-001 נמחק, YAGNI-002 נשאר ומתועד כהחלטה סגורה. עשר ההצעות שנדחו — אישו #3442. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx * fix(normalize): וריאציה-סלקטור מוסר לפי קוד התו ולא לפי צורת הכתיב — \U0000FE0F כמו \uFE0F (CodeRabbit על #3443) הענף של \UXXXXXXXX ב-strip_hidden_escapes בדק רק את הטווח האידאוגרפי (U+E0100–U+E01EF), ולכן \U0000FE0F נשאר כמות שהוא בזמן ש-\uFE0F הוסר עם remove_variation_selectors=True. עכשיו כלל אחד (_is_hidden) לשתי הצורות: Cf תמיד, ושני טווחי ה-VS רק לפי בקשה. טסט רגרסיה שנפל על הקוד הישן. Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx --------- Co-authored-by: Claude <noreply@anthropic.com>
|
נכנס דרך #3443 |
✨ תיאור קצר
candidatesהיה השדה היחיד בתשובתcodekeeper_docs_get_sectionבלי תקרה:tocחסום ב-400,suggestionsב-50, ורק המועמדים חזרו כולם. נמדד בסקירת feat(mcp): docs_get_section מוצא סעיף לפי מזהה, ולא רק לפי השם המלא #3425: עמוד סינתטי של 512KB עם 13,030 כותרות שנפתחות ב-K11.החזיר 13,030 מועמדים — 1,393,787 בתים ושיא הקצאה של 12.6MB — על שאילתה בת שלושה תווים. הענף נדלק מכותרות שנושאות מזהה, ומאז feat(mcp): docs_get_section קורא גם Markdown, לפי מדיניות נתיבים לכל ריפו #3428 הקורפוס שנושא אותם (amir-bug-patterns) מוגש, ולכן זה חוב פתוח בייצור ולא מניעה.candidates_truncated: trueרק כשנחתך — אותה מוסכמה שלsuggestions_truncated,remaining_charsו-next_offset. ובאותו PR: טסט שמקבע שגם במסלול ה-Markdownsuggestionsהוא רשימת מחרוזות ולא ה-NamedTuple(הפריט השני ב-docs_get_section: תקרה ל-candidates, ושמירת חוזה Suggestions — לפני שחיבור ה-Markdown נוחת #3426).📦 שינויים עיקריים
פירוט נקודות (רשימת תבליטים):
candidatesנבנה מכלmatchesבלי גבול); פריט 2 השתנה מאז שנכתב — "הצרכן השני" מ-feat(mcp): docs_get_section קורא גם Markdown, לפי מדיניות נתיבים לכל ריפו #3428 הוא בפועל אותו אתר קריאה שמשרת את שני הפורמטים (doc_sections.suggestנקרא פעם אחת ב-docs_handlers), והוא כבר כותב.titles. לכן שם אין תיקון, יש טסט שמקבע.mcp_server/docs_handlers.py:_CANDIDATES_MAX = 50— אותו מספר כמוdoc_sections.MAX_IDENTIFIER_SUGGESTIONSומאותה סיבה: רשימת המועמדים היא מלאי בסדר הופעה ולא דירוג, ולכן חיתוך שלה מסתיר פריטים בלי קריטריון, והתקרה גבוהה מספיק שכל עמוד אמיתי ייענה במלואו (כותרת כפולה בקורפוס חוזרת פעמיים או שלוש). השוויון בין שני המספרים מקובע בטסט, כמו שני גבולות האאוטליין והפארסר.toc(שהיה inline ב-_toc) ושלcandidatesעובר דרך עוזר אחד,_capped(items, limit), שמחזיר(items, truncated)—Trueרק כשהיו יותר מהתקרה, ולעולם לא על רשימה שבדיוק בגודלה (אותו גבול כמוCapped.appendו-max_sections).ambiguous_sectionבתצלום בלי ששום התנהגות השתנתה.sectionב-mcp_server/server.pyאומר את התקרה והדגל;docs/mcp-server.rst(הסעיף עלambiguous_section) ו-docs/whats-new.rstעודכנו.server.pyלפני_build_docs_path_doc— E302 שהגיע עם feat(mcp): docs_get_section קורא גם Markdown, לפי מדיניות נתיבים לכל ריפו #3428; CI בוחר רקE9,F63,F7,F82ולכן לא נפל שם, אבלflake8בקונפיג של הריפו כן.🧪 בדיקות
tests/test_mcp_docs_handlers.py+tests/test_doc_sections.py, ו-36 ב-tests/test_mcp_server_build.py, ירוקים; flake8 נקי.test_candidates_are_capped_and_the_flag_appears_only_when_they_were_cut(התקרה מוקטנת ל-2 דרך המודול, כמו בטסט תקרת הסקשנים, במקום לבנות 51 כותרות: בדיוק בתקרה — בלי דגל; מעליה — שני הראשונים בסדר הופעה והדגלTrue),test_the_candidates_cap_is_the_suggestions_inventory_number, ו-test_suggestions_on_a_markdown_page_are_a_list_of_strings_too(דרך הריפו של ה-Markdown,both_repos).origin/main, ב-worktree נפרד): טסט התקרה וטסט השוויון נופלים; טסט ה-Markdown עובר — הוא מקבע התנהגות קיימת, וזה מה שהאישו ביקש.scripts/docs_section_zero_diff.pyעל אותו קורפוס (ה-docs/שלorigin/main, כדי שעריכות התיעוד של ה-PR לא יזהמו את ההשוואה), פעם על הקוד הישן ופעם על החדש — 5,928 רשומות בשתיהן,sha256זהה (f31c53f5…2db87),cmpבינארי: זהה.🧪 בדיקות נדרשות ב‑PR
📝 סוג שינוי
✅ צ'קליסט
docs/whats-new.rstAI-MAP.md←docs/mcp-server.rst("איך docs_get_section מוצא כותרת", והסעיף על 50 ההצעות) | המשפט: "והכמות: עד 50 הצעות. ... התקרה גבוהה מספיק כדי שעמוד רגיל ייענה במלואו" — זה הנימוק שהתקרה החדשה יורשת. וגםdocs/doc-authoring.rst(בלי מספרי שורות, בלי שינוי עוגנים). מ-amir-bug-patterns:bugbot-rules/silent-truncation-at-sink.md(חיתוך שאינו שקט — הדגל),RECURRING-PATTERNS.mdR6 (עוזר אחד לשני הגבולות),claude-md-snippets/testing.md(הטסטים הורצו על הקוד הישן).🧩 השפעות/סיכונים
ambiguous_sectionנושאת לכל היותר 50 מועמדים, ומעבר לזהcandidates_truncated: true. אף עמוד אמיתי בקורפוס אינו מגיע לזה (אפס-דיף על 208 קובצי ה-RST), ולכן ההשפעה בפועל היא רק על קלט שנבנה בכוונה.🔗 קישורים
code-review-3425-identifier-lookup.mdב-CodeKeeper🧯 סיכון / החזרה לאחור (Rollback)
🤖 Generated with Claude Code
https://claude.ai/code/session_01SfJTSpDAhDr2yhtmpFkwTx
Generated by Claude Code
Summary by Sourcery
Prevent oversized ambiguous-section responses while preserving existing results and suggestion output contracts.
Bug Fixes:
Enhancements:
Documentation:
Tests: