|
1.LLMs for Survey Text Analysis - A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis(arxiv.org)
45 pts·arXiv cs.AI··research
83 pts·arXiv cs.AI··research
74 pts·thomsonreuters.com··news
4.I Tried to Run Qwen3.8–27B on a 16GB Mac Mini with AirLLM. Here’s Exactly Where It Breaks(pub.towardsai.net)
39 pts·Towards AI··infra
5.Pew study confirms sharp rise of AI-written text on the web since ChatGPT's launch(the-decoder.com)
44 pts·The Decoder··research
39 pts·Simon Willison··tools
7.LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization(arxiv.org)
39 pts·arXiv cs.AI··research
8.Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL(arxiv.org)
35 pts·arXiv cs.AI··research
42 pts·arXiv cs.AI··research
47 pts·arXiv cs.LG··research
11.Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion(arxiv.org)
83 pts·arXiv cs.AI··research
35 pts·arXiv cs.AI··research
71 pts·arXiv cs.CL··research
46 pts·arXiv cs.CL··research
46 pts·Towards AI··tools
16.Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap(arxiv.org)
66 pts·arXiv cs.AI··research
17.There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items(arxiv.org)
60 pts·arXiv cs.AI··research
81 pts·arXiv cs.AI··research
19.Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents(arxiv.org)
48 pts·arXiv cs.AI··research
72 pts·arXiv cs.AI··research
21.KAN-Robust-Bench: A Benchmark for Evaluating the Robustness of Kolmogorov-Arnold Networks(arxiv.org)
31 pts·arXiv cs.AI··research
22.Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning(arxiv.org)
52 pts·arXiv cs.AI··research
34 pts·arXiv cs.AI··research
24.WildHandBench: A Benchmark for Handwritten Text Understanding that Challenges MLLMs and Humans(arxiv.org)
62 pts·arXiv cs.AI··research
25.NetConfArena: An Executable Benchmark for LLM Agents in Closed-Loop Network Configuration(arxiv.org)
66 pts·arXiv cs.AI··research
55 pts·arXiv cs.AI··research
45 pts·arXiv cs.AI··research
28.Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration(arxiv.org)
64 pts·arXiv cs.AI··research
32 pts·arXiv cs.AI··research
30.Time Series Forecasting via Reasoning: A Slow-Thinking Approach with Reinforcement Fine-Tuned LLMs(arxiv.org)
34 pts·arXiv cs.AI··research
30 of 500